Skip to main content

Rilevamento oggetti

Il rilevamento di oggetti è una tecnica di visione artificiale che identifica e localizza più oggetti all'interno di un'immagine, prevedendone la classe e la posizione tramite riquadri di delimitazione. A differenza della classificazione delle immagini, che assegna un'unica etichetta all'intera immagine, il rilevamento di oggetti individua i singoli oggetti e ne determina la posizione.

Nell'elaborazione dei documenti, il rilevamento di oggetti può individuare elementi come numeri di fattura, date, informazioni su clienti e fornitori, totali, loghi, firme e dettagli di pagamento.

LogicalDOC utilizza il rilevamento di oggetti per identificare le aree rilevanti all'interno dei documenti aziendali prima dell'estrazione del testo. Isolando le aree di interesse, l'OCR può essere applicato solo dove necessario, migliorando la precisione dell'estrazione dei dati e consentendo flussi di lavoro automatizzati per l'elaborazione dei documenti. Le applicazioni tipiche includono l'elaborazione delle fatture, la gestione degli ordini di acquisto, l'analisi dei contratti, l'elaborazione dei moduli e l'estrazione di informazioni strutturate da documenti aziendali.

Modelli YOLO

LogicalDOC supporta modelli di rilevamento di oggetti basati sull'architettura YOLO (You Only Look Once). YOLO è una famiglia di modelli di deep learning progettati per il rilevamento di oggetti in tempo reale, che analizzano un'immagine in un singolo passaggio e prevedono sia la classe che la posizione degli oggetti rilevati.

I modelli YOLO addestrati possono essere importati in LogicalDOC e utilizzati per rilevare le regioni del documento durante l'elaborazione, consentendo l'estrazione di informazioni strutturate da documenti scansionati o digitali.

Prerequisiti

Prima di utilizzare il rilevamento di oggetti, è necessario disporre di un modello YOLO addestrato in LogicalDOC.

Il modello deve essere addestrato su un dataset annotato. Le immagini dei documenti possono essere annotate utilizzando strumenti come Label Studio (consultare la guida Label Studio Wiki Guide oppure Label Studio Website), dopodiché il modello YOLO addestrato può essere importato in LogicalDOC per l'inferenza.

Queste immagini sono solo un esempio di documenti annotati; per maggiori informazioni, consultare le risorse collegate in precedenza.

annotations2
annotations3
annotations4
annotations5

Flusso di lavoro tipico

Il tipico flusso di lavoro di rilevamento degli oggetti consiste nei seguenti passaggi:

  1. Creare un progetto e caricare le immagini dei documenti in Label Studio.
  2. Annotare gli elementi del documento che devono essere rilevati.
  3. Esportare il dataset annotato.
  4. Addestrare un modello YOLO utilizzando il dataset esportato.
  5. Importare il modello addestrato in LogicalDOC.
  6. Eseguire i rilevamenti su nuovi documenti.
  7. Rivedere e utilizzare le regioni rilevate nei flussi di lavoro di elaborazione successivi.

Casi d'uso supportati

Il rilevamento di oggetti è particolarmente utile per i documenti che contengono informazioni in posizioni o strutture visive prevedibili. Esempi tipici includono fatture, ordini di acquisto, moduli di richiesta, contratti, documenti di spedizione e altri documenti aziendali strutturati.

Le aree rilevate possono essere successivamente utilizzate da motori OCR, classificatori basati sull'intelligenza artificiale o flussi di lavoro di automazione personalizzati per estrarre ed elaborare le informazioni del documento.

Creazione di un modello YOLO

In Amministrazione > Intelligenza Artificiale > Modelli, aggiungi un nuovo modello e seleziona il tipo YOLO.

yolo-selection
 

Durante la creazione del modello, specificare il Nome e l'Etichetta, quindi configurare le proprietà specifiche del modello:

  • Categorie: l'elenco delle classi di oggetti che il modello può rilevare, anche note come Etichette. Queste devono corrispondere alle classi utilizzate durante l'addestramento.
  • Larghezza e Altezza delle immagini di addestramento: le dimensioni (in pixel) delle immagini utilizzate per addestrare il modello. Questi valori devono corrispondere alla configurazione di addestramento.
  • Soglia: il punteggio di confidenza minimo richiesto affinché un oggetto rilevato venga accettato. I rilevamenti con un punteggio di confidenza inferiore alla soglia vengono scartati. Valori inferiori restituiscono un maggior numero di rilevamenti, ma potrebbero includere falsi positivi, mentre valori superiori restituiscono un numero inferiore di rilevamenti, ma più affidabili.

yolo-model-selection
 

Info

Per il corretto funzionamento del modello creato, le categorie e la larghezza e l'altezza delle immagini di addestramento devono corrispondere alle impostazioni utilizzate durante la fase di addestramento.

Una volta creato il modello YOLO in LogicalDOC, fai clic con il pulsante destro del mouse sul modello e seleziona Importa per caricare il file del modello .onnx addestrato.

Per ulteriori informazioni su come importare il modello già addestrato, consultare l'articolo Installare un modello addestrato.