Detección de objetos
La detección de objetos es una técnica de visión artificial que identifica y localiza múltiples objetos dentro de una imagen prediciendo sus clases y posiciones mediante cuadros delimitadores. A diferencia de la clasificación de imágenes, que asigna una única etiqueta a toda la imagen, la detección de objetos detecta objetos individuales y determina su ubicación.
En el procesamiento de documentos, la detección de objetos permite localizar elementos como números de factura, fechas, información de clientes y proveedores, totales, logotipos, firmas y detalles de pago.
LogicalDOC utiliza la detección de objetos para identificar regiones relevantes dentro de los documentos comerciales antes de la extracción de texto. Al aislar las áreas de interés, el OCR se puede aplicar solo donde sea necesario, mejorando la precisión de la extracción de datos y posibilitando flujos de trabajo automatizados para el procesamiento de documentos. Entre las aplicaciones típicas se incluyen el procesamiento de facturas, la gestión de órdenes de compra, el análisis de contratos, el procesamiento de formularios y la extracción de información estructurada de documentos comerciales.
Modelos YOLO
LogicalDOC admite modelos de detección de objetos basados en la arquitectura YOLO (You Only Look Once). YOLO es una familia de modelos de aprendizaje profundo diseñados para la detección de objetos en tiempo real que analiza una imagen en una sola pasada y predice tanto la clase como la ubicación de los objetos detectados.
Los modelos YOLO entrenados se pueden importar a LogicalDOC y utilizar para detectar regiones de documentos durante el procesamiento, lo que permite extraer información estructurada de documentos escaneados o digitales.
Requisitos previos
Antes de usar la detección de objetos, debe disponer de un modelo YOLO entrenado en LogicalDOC.
El modelo debe entrenarse con un conjunto de datos anotado. Las imágenes de los documentos se pueden anotar con herramientas como Label Studio (consulte Label Studio Wiki Guide o Label Studio Website). Posteriormente, el modelo YOLO entrenado se puede importar a LogicalDOC para realizar inferencias.
Estas imágenes son solo un ejemplo de documentos anotados. Para obtener más información, consulte los recursos mencionados anteriormente.
Flujo de trabajo típico
El flujo de trabajo típico de detección de objetos consta de los siguientes pasos:
- Crear un proyecto y cargar imágenes de documentos en Label Studio.
- Anotar los elementos del documento que se deben detectar.
- Exportar el conjunto de datos anotado.
- Entrenar un modelo YOLO con el conjunto de datos exportado.
- Importar el modelo entrenado a LogicalDOC.
- Realizar detecciones en nuevos documentos.
- Revisar y utilizar las regiones detectadas en flujos de trabajo de procesamiento posteriores.
Casos de uso compatibles
La detección de objetos es especialmente útil para documentos que contienen información en ubicaciones predecibles o estructuras visuales. Algunos ejemplos típicos son facturas, órdenes de compra, formularios de solicitud, contratos, documentos de envío y otros documentos comerciales estructurados.
Las regiones detectadas pueden ser utilizadas posteriormente por motores OCR, clasificadores de IA o flujos de trabajo de automatización personalizados para extraer y procesar la información del documento.
Creando un modelo YOLO
En Administración > Inteligencia Artificial > Modelos, agregue un nuevo modelo y seleccione el tipo YOLO.
Al crear el modelo, especifique el nombre y la etiqueta, y luego configure las propiedades específicas del modelo:
- Categorías: la lista de clases de objetos que el modelo puede detectar, tambien conocidas como Etiquetas. Estas deben coincidir con las clases utilizadas durante el entrenamiento.
- Ancho y alto de las imágenes de entrenamiento: las dimensiones (en píxeles) de las imágenes utilizadas para entrenar el modelo. Estos valores deben coincidir con la configuración de entrenamiento.
- Umbral: el nivel mínimo de confianza requerido para que un objeto detectado sea aceptado. Las detecciones con un nivel de confianza inferior al umbral se descartan. Los valores más bajos generan más detecciones, pero pueden incluir falsos positivos, mientras que los valores más altos generan menos detecciones, pero más fiables.
Info
Para el correcto funcionamiento del modelo creado, las categorías y el ancho y la altura de las imágenes de entrenamiento deben coincidir con la configuración utilizada durante la fase de entrenamiento.
Una vez creado el modelo YOLO en LogicalDOC, haga clic con el botón derecho en el modelo y seleccione Importar para cargar el archivo del modelo .onnx entrenado.

Para obtener más información sobre cómo importar su modelo ya entrenado, consulte el artículo Instalar un modelo entrenado.





