Sistema AI per l’estrazione dei dati dai display dei treni
Computer Vision • OCR • YOLOv11 Detection • Pipeline di automazione
Computer Vision • OCR • YOLOv11 Detection • Pipeline di automazione
Il cliente acquisiva da 4.000 a 12.000 immagini per viaggio in treno, fotografando il display di bordo relativo a energia e trazione ogni 1–3 secondi. L’estrazione manuale era impraticabile a causa di immagini sfocate, variazioni di illuminazione (gallerie, riflessi, ombre), problemi di messa a fuoco e prospettive inclinate.
L’obiettivo era realizzare un sistema AI automatizzato capace di leggere sei indicatori principali dalle immagini dei display
L’OCR tradizionale non funzionava perché molti valori non erano testuali, ma rappresentati da livelli di barre, indicatori triangolari e lancette. Serviva un modello di visione capace di rilevare barre, segmenti e marcatori geometrici, oltre a leggere il testo.
Il dataset presentava:
• Immagini scure nelle gallerie
• Forti riflessi sul vetro
• Gradienti di ombra
• Sfocatura da movimento
• Vibrazioni della fotocamera e lieve rotazione
• Instabilità della messa a fuoco automatica
• Luminosità e contrasto irregolari
Ho sviluppato una pipeline di estrazione in due fasi che combina YOLOv11-M, OCR ed elaborazione cloud AWS:
Modello YOLOv11-M per il rilevamento degli elementi visivi
OCR e AWS per i valori numerici
Strutturazione dei dati in Excel
Fasi del progetto
Annotazione completa e addestramento di YOLOv11-M per rilevare tutti gli elementi visivi del display del treno: grafici a barre, picchi delle barre, direzione della trazione (blu e rosso), triangolo indicatore della corrente e aree degli strumenti di misura.
Il modello è stato ottimizzato per gestire sfocatura, riflessi, gallerie scure, rotazione e messa a fuoco instabile.
Sviluppo di una pipeline OCR robusta con AWS Textract per estrarre campi numerici come consumo energetico, recupero di energia, corrente e velocità.
Include pulizia del testo, normalizzazione, correzioni specifiche di settore e un’applicazione automatizzata che esporta tutti i dati elaborati direttamente in un file Excel strutturato, pronto per l’analisi.
Conclusione del progetto
Il progetto realizza un sistema completamente automatizzato per estrarre e interpretare i dati dalle immagini dei display dei treni, combinando OCR avanzato, rilevamento visivo YOLOv11-M e generazione di file Excel strutturati. La pipeline combinata raggiunge una precisione vicina al 100%, anche in condizioni difficili come sfocatura, riflessi, gallerie scure, inquadrature inclinate e illuminazione irregolare.
Il sistema è stato testato ampiamente su nuovi dataset forniti dal cliente, confermando prestazioni stabili e una buona capacità di generalizzazione su immagini mai viste. Grazie all’elevata precisione e affidabilità, il cliente ha richiesto subito altri progetti simili, confermando il successo e il valore concreto della soluzione.
Risultati
• Estrazione affidabile di tutte le metriche dei display, anche da immagini instabili o di bassa qualità
• Precisione quasi perfetta grazie a un modello YOLOv11-M personalizzato e alle fasi di validazione OCR
• Notevole risparmio di tempo per il cliente, eliminando la revisione manuale di migliaia di immagini
• Pipeline scalabile, pronta per estensioni future, nuovi indicatori e funzionalità di automazione
• La qualità del progetto ha portato il cliente a commissionare diversi ordini successivi
⭐ Recensioni dei clienti