Aprendizaje profundo: La respuesta para proyectos desafiantes de reconocimiento de caracteres


El OCR de aprendizaje profundo simplifica los proyectos desafiantes de reconocimiento de caracteres en aplicaciones de empaque, envío y logística.

DPM code on an automotive part being read by a ZebraFS42 scanner

 Introducción

El crecimiento del comercio electrónico y del comercio global aumenta significativamente el volumen de bienes transportados. Esa es una de las razones por las que la automatización en empaque, envío y logística se está volviendo cada vez más importante. La automatización también ayuda a las empresas a empaquetar productos de manera más rápida y precisa, mejora la clasificación y manipulación de paquetes, y mejora la administración de almacén y el transporte, lo que permite a las empresas operar de manera más eficiente, cumplir con las expectativas de los clientes y mantenerse competitivas en el mercado actual, que cambia rápidamente.

El reconocimiento óptico de caracteres (OCR), una tecnología que permite a las máquinas reconocer y extraer texto de imágenes, desempeña un papel crucial en los sistemas automatizados que escanean, clasifican y etiquetan paquetes. Al convertir rápidamente el texto impreso o escrito a mano de las etiquetas o documentos de envío en datos digitales, el OCR elimina la necesidad de entrada manual de datos, reduciendo errores y ahorrando tiempo.

Aunque el OCR continúa avanzando y puede abordar una amplia gama de formatos de empaque y etiquetado, las fuentes estilizadas, los caracteres distorsionados u ocultos, las superficies reflectantes y los fondos intrincados siguen siendo un desafío que solo puede abordarse mediante el aprendizaje profundo (DL).

A medida que aumentan las tasas de producción, empaque y clasificación para satisfacer una mayor demanda, también lo hacen los requisitos y regulaciones de etiquetado. Los paquetes y envíos deben cumplir con estándares de etiquetado específicos, incluidos códigos de barras 1D y 2D, números de identificación de productos, así como requisitos de etiquetado de alérgenos y país de origen.

La tecnología OCR permite el reconocimiento y la interpretación automáticos de estas etiquetas, lo que garantiza el cumplimiento y permite una trazabilidad sin problemas a lo largo de la cadena de suministro, mientras que el aprendizaje profundo ayuda a mejorar la precisión y fiabilidad del proceso de reconocimiento. Esto ayuda a las empresas a cumplir con los requisitos normativos, mejorar la administración de inventario y mejorar la eficiencia operativa general.

Beneficios de la OCR

El OCR ayuda a mejorar la precisión y trazabilidad de paquetes y envíos. Al leer e interpretar automáticamente las etiquetas de envío, los sistemas OCR pueden garantizar que los paquetes estén etiquetados con precisión, clasificados y rastreados a lo largo de la cadena de suministro. Esto reduce las posibilidades de paquetes mal dirigidos o perdidos, lo que lleva a una mayor satisfacción del cliente y a la mejora de los márgenes de beneficio.

El OCR reconoce y registra automáticamente productos y números de serie, junto con códigos de barras 1D y 2D o códigos QR en el empaque para permitir una administración de inventario eficiente. Al automatizar el seguimiento y la actualización de los niveles de stock, la tecnología OCR ayuda a reducir el esfuerzo manual y el riesgo de errores humanos. Los datos precisos del inventario permiten a las empresas optimizar sus operaciones de la cadena de suministro y evitar tanto la falta como el exceso de existencias.

Al automatizar la extracción y el procesamiento de la información textual, la OCR contribuye a la eficiencia operativa general. Permite un procesamiento más rápido de los documentos, reduce la intervención manual y acelera los procesos de toma de decisiones. Esta mejora en la eficiencia se traduce en un procesamiento más rápido de los pedidos, una mayor precisión en los envíos y una mayor productividad en diversas aplicaciones de embalaje, envío y logística.

Beneficios
  • Asegúrese de que el embalaje y las etiquetas contengan texto preciso y legible
  • Inspeccione y lea los códigos de fecha y lote
  • Mejore las operaciones de seguimiento y localización
  • Permita el máximo rendimiento en las aplicaciones de embalaje

Desafíos del OCR tradicional

La OCR ha evolucionado para abordar los desafíos que presentan los diversos formatos de embalaje y etiquetado, pero las fuentes estilizadas, los caracteres distorsionados u ocultos, las superficies reflectantes y los fondos complejos pueden suponer dificultades para las técnicas tradicionales de OCR, que son enseñadas al sistema y, por tanto, suelen requerir profesionales de la imagen industrial para su configuración, entrenamiento e implementación (Figura 1).

El entrenamiento de un sistema tradicional de OCR implica varios pasos. En primer lugar, las imágenes de entrada se preprocesan para mejorar su calidad y prepararlas para el reconocimiento de caracteres. Esto puede implicar tareas como la reducción de ruido, la binarización de la imagen (convertirla a blanco y negro) y la enderezamiento (ajustar la imagen para corregir la rotación).

El siguiente paso es la segmentación. La imagen preprocesada se divide en caracteres o líneas de texto individuales. Este paso separa los caracteres o líneas entre sí, facilitando su reconocimiento y análisis por separado. A continuación, se extraen características de cada carácter segmentado. Estas características son rasgos distintivos que ayudan a diferenciar un carácter de otro. Los sistemas de OCR tradicionales utilizan diversas técnicas para extraer características, como analizar los contornos, trazos y otras propiedades geométricas de los caracteres. 

Se crea un conjunto de datos de entrenamiento etiquetando las características extraídas con sus caracteres correspondientes. Para entrenar eficazmente el sistema de OCR, es necesario un conjunto diverso de imágenes de entrenamiento que cubran diferentes fuentes, tamaños, estilos, orientaciones y condiciones de ruido que el sistema podría encontrar en escenarios del mundo real. Los operadores humanos anotan manualmente cada carácter en las imágenes de entrenamiento para crear un conjunto de datos que empareja las características de los caracteres con sus etiquetas correctas.

Luego viene el entrenamiento del clasificador, donde se entrena un algoritmo de clasificación utilizando los datos de entrenamiento etiquetados. Este algoritmo aprende a reconocer patrones en las características extraídas y asociarlos con los caracteres correspondientes. Los algoritmos comunes utilizados en los sistemas de OCR tradicionales incluyen máquinas de vectores de soporte, modelos de Markov ocultos y vecinos más cercanos.

A continuación, se evalúa el clasificador entrenado utilizando un conjunto separado de datos de prueba. Esta evaluación mide la precisión y el rendimiento del sistema de OCR. Si el rendimiento no es satisfactorio, el proceso de entrenamiento puede repetirse ajustando parámetros, mejorando las técnicas de preprocesamiento o ampliando el conjunto de datos de entrenamiento.

Una vez que el sistema de OCR alcanza el nivel de precisión deseado, puede implementarse para reconocer caracteres en nuevas imágenes no vistas. La imagen preprocesada se segmenta y el clasificador entrenado se utiliza para reconocer y convertir los caracteres segmentados en texto digital. Es importante señalar que los sistemas de OCR tradicionales dependen en gran medida de características creadas a mano y algoritmos específicos, lo que los hace menos adaptables a diferentes estilos de fuente, tamaños e idiomas en comparación con los sistemas de OCR basados en aprendizaje profundo.

5 examples of printed products which are difficult to scan  using Traditional OCR methods due to reflective surfaces, printing on curved surfaces, and characters that are skewed, distorted, or obscured

Figura 1: Los métodos tradicionales de OCR pueden encontrar desafíos al tratar con superficies reflectantes, impresión en superficies curvas y caracteres que están sesgados, distorsionados u ocultos.

Figura 2: Los sistemas de OCR tradicionales son enseñados por el usuario, lo que implica varios pasos, incluyendo preprocesamiento, segmentación, etiquetado, clasificación y evaluación del algoritmo.

Examples of challenging character recognition including complex backgrounds, blurry or damaged characters, distortion, or reflective surfaces that make traditional OCR techniques ineffective.

Figura 3: Las capacidades de OCR proporcionadas por la herramienta DL-OCR ofrecen una solución para proyectos de reconocimiento de caracteres desafiantes. Estos proyectos involucran fondos complejos, caracteres borrosos o dañados, distorsión o superficies reflectantes que hacen que las técnicas tradicionales de OCR sean ineficaces. La herramienta incluye una red neuronal preentrenada, lista para usar con miles de muestras de imágenes diversas. Alcanza una precisión de aproximadamente el 97% desde el inicio, incluso en escenarios muy difíciles.

Introduzca el aprendizaje profundo

La inteligencia artificial y el aprendizaje automático, y específicamente el aprendizaje profundo, presentan una solución prometedora a los desafíos de las soluciones de OCR. Con el uso de algoritmos de aprendizaje profundo, se hace posible detectar irregularidades en patrones, incluso cuando los caracteres alfanuméricos son difíciles de definir usando reglas rígidas, y se están realizando avances para abordar estos desafíos y mejorar el proceso de OCR. 

Los enfoques modernos, como el OCR basado en aprendizaje profundo, aprovechan las redes neuronales convolucionales (CNN) y las redes neuronales recurrentes (RNN) para aprender y extraer automáticamente características de los caracteres, reduciendo la dependencia de características diseñadas explícitamente. Estos modelos pueden manejar una variedad más amplia de fuentes y adaptarse más rápido y de manera más efectiva a fuentes nuevas o desconocidas sin requerir ajustes manuales extensos.

El proceso de recopilar y anotar grandes conjuntos de datos necesarios para entrenar modelos de aprendizaje profundo, sin embargo, ha surgido como un obstáculo para la implementación generalizada. El número de imágenes requeridas para un conjunto de datos varía según la complejidad de la aplicación de lectura de códigos , y a menudo se determina a través de la experimentación y el refinamiento iterativo para lograr el rendimiento deseado.

La actualización del proceso de OCR para manejar los cambios de fuente de manera más eficiente es un área continua de investigación y desarrollo, con el objetivo de reducir la carga de ajustes manuales y mejorar la adaptabilidad del sistema a nuevas fuentes y variaciones de texto (Figura 3). Para este propósito, también se están empleando técnicas de aprendizaje por transferencia para aprovechar modelos preentrenados en grandes conjuntos de datos, lo que permite una mejor generalización y reduce la necesidad de datos de entrenamiento excesivos para cada fuente específica.

Herramienta de aprendizaje profundo OCR de Zebra

Los avances en OCR han hecho posible superar todos estos desafíos. Por ejemplo, la herramienta de OCR de aprendizaje profundo (DL-OCR) de calidad industrial es un complemento del software Zebra Aurora Focus™ que hace que la lectura de texto sea rápida y fácil. DL-OCR viene con una red neuronal lista para usar que está preentrenada usando miles de muestras de imágenes diferentes. Por lo tanto, ofrece una alta precisión desde el primer momento, incluso cuando se trata de casos muy difíciles. Los usuarios pueden crear aplicaciones de OCR robustas en solo unos pocos pasos, todo sin necesidad de experiencia en visión artificial (Figura 4). La interfaz intuitiva del software Zebra Aurora Focus facilita la configuración, y el sistema se puede implementar en solo minutos.

A diferencia de las aplicaciones tradicionales de OCR, Zebra ha adoptado un enfoque de aprendizaje cero con su herramienta DL-OCR, que ofrece lecturas precisas sin necesidad de entrenar diferentes textos o fuentes por adelantado. La herramienta también aprovecha técnicas de vanguardia que permiten a los principiantes configurar fácilmente aplicaciones de reconocimiento de texto y lectura desafiantes de forma rápida y precisa. Otra ventaja clave de la herramienta DL-OCR es su capacidad para manejar de manera más efectiva el texto inconsistente o con contraste degradado.

Con la nueva herramienta, una implementación de Aurora Focus DL-OCR puede simplificarse a unos pocos pasos rápidos: colocar la región de interés (ROI) alrededor del texto a leer, fijar la ROI a una herramienta de localización que facilita la lectura cuando la pieza se mueve o rota dentro del campo de visión de la cámara, y ajustar algunos umbrales que ayudan a diferenciar entre diferentes cadenas de caracteres, incluyendo tamaño o espaciado alfanumérico o matemático según sea necesario.

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Figura 4: Los usuarios de DL-OCR de Zebra pueden crear fácilmente una aplicación de OCR robusta con solo unos pocos pasos simples, sin necesidad de contar con amplia experiencia en visión artificial. 

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Figura 5: Las características clave de la herramienta DL-OCR de Zebra incluyen su preparación para el uso, la capacidad de manejar casos de OCR difíciles que no son alcanzables con métodos tradicionales, alta precisión lista para usar, facilidad de uso y compatibilidad tanto con una GPU NVIDIA como con CPU.

Escalabilidad y optimización completas

Como parte del software Aurora de Zebra, la herramienta DL-OCR se puede implementar en una gama de productos diferentes, incluyendo cualquier escáner industrial fijo FS o cámara inteligente VS, ofreciendo una implementación en cámara que proporciona un sistema de inspección compacto y autónomo. Las plataformas de cámara inteligente integradas presentan un enfoque más rápido y sencillo para configurar y capturar imágenes para diversas aplicaciones de OCR en comparación con los sistemas tradicionales de visión inteligente basados en PC industrial.

Sin embargo, los usuarios finales no están limitados a implementar la herramienta solo en dispositivos de Zebra, ya que el software Aurora se puede implementar de manera confiable en PCs industriales y controladores de visión de terceros disponibles en el mercado actual. Con la constante expansión y evolución de las necesidades de los clientes, los usuarios finales necesitan herramientas que no solo sean efectivas, sino también fáciles de usar. La nueva herramienta DL-OCR fue diseñada con esto en mente, ya que no requiere entrenamiento y se puede implementar en sistemas de borde o distribuidos, ofreciendo a los usuarios la flexibilidad necesaria para implementar un sistema que satisfaga sus necesidades exactas y pueda ser escalado y optimizado según sea necesario.

Independientemente de la plataforma de hardware seleccionada, las herramientas de aprendizaje profundo ofrecen varias ventajas en las aplicaciones de OCR en comparación con los métodos tradicionales de OCR. Los sistemas DL-OCR, como el de Zebra Technologies, pueden leer fuentes directamente y seguirán aprendiendo aún más a medida que el equipo de Zebra entrene el algoritmo en nuevas imágenes y muestras para las versiones de software posteriores. Este enfoque de aprendizaje de extremo a extremo elimina la necesidad de extracción explícita de características, lo que hace que el sistema sea más adaptable a diversas fuentes, idiomas y estilos (Figura 5). Los sistemas tradicionales de OCR requieren características manuales, que pueden ser menos flexibles de implementar y llevar más tiempo mantenerlas.

4SightXV6

Zebra VS40 machine vision smart sensor

Cámara inteligente de visión inteligente VS40

Conclusión


Los modelos de aprendizaje profundo han demostrado un rendimiento superior en tareas de reconocimiento de caracteres. Pueden aprender e identificar automáticamente patrones complejos, lo que los hace altamente efectivos para manejar variaciones en caracteres, ruido y distorsión. Los modelos de aprendizaje profundo a menudo logran tasas de precisión más altas en comparación con los métodos tradicionales de OCR, lo que ahorra tiempo y dinero a los fabricantes e integradores, al mismo tiempo que permite un OCR que puede lidiar más eficazmente con texto que podría ser inconsistente o tener un contraste degradado.

 

Implementar el aprendizaje profundo en aplicaciones de OCR no tiene por qué ser difícil. Zebra DL-OCR aporta ventajas significativas a la automatización de los procesos de empaque, envío y logística, ofreciendo una solución de OCR fácil de implementar que se puede configurar en minutos y que aborda eficazmente desafíos como el escaneo automatizado de paquetes, la clasificación y las tareas de etiquetado, a la vez que mejora la precisión, la trazabilidad y el cumplimiento con los estándares de etiquetado.

 

Para obtener más información sobre la herramienta DL-OCR de Zebra y el software de visión artificial, haga clic a continuación.