Aprendizagem Profunda: A Solução para Projetos Desafiosos de Reconhecimento de Caracteres


A Aprendizagem Profunda em OCR simplifica projetos desafiadores de reconhecimento de caracteres em aplicações de embalagem, envio e logística.

DPM code on an automotive part being read by a ZebraFS42 scanner

Introdução

O crescimento do comércio eletrônico e do comércio global impulsiona significativamente o volume de mercadorias transportadas. Essa é uma das razões pelas quais a automação em embalagem, envio e logística está se tornando cada vez mais importante. A automação também ajuda as empresas a embalar produtos de forma mais rápida e precisa, melhora a classificação e o manuseio de pacotes, e aprimora o gerenciamento de armazéns e o transporte, permitindo que as empresas operem de forma mais eficiente, atendam às expectativas dos clientes e permaneçam competitivas no mercado atual, que é rápido e em constante evolução.

O reconhecimento óptico de caracteres (OCR), uma tecnologia que permite que as máquinas reconheçam e extraiam texto de imagens, desempenha um papel crucial em sistemas automatizados que digitalizam, classificam e rotulam pacotes. Ao converter rapidamente texto impresso ou manuscrito de etiquetas de envio ou documentos em dados digitais, o OCR elimina a necessidade de entrada manual de dados, reduzindo erros e economizando tempo.

Embora o OCR continue a avançar e possa lidar com uma ampla gama de formatos de embalagem e rotulagem, fontes estilizadas, caracteres distorcidos ou ocultos, superfícies reflexivas e fundos complexos permanecem um desafio que só pode ser superado pela aprendizagem profunda (DL).

À medida que as taxas de produção, embalagem e classificação aumentam para atender à maior demanda, também aumentam os requisitos e regulamentos de rotulagem. Os pacotes e remessas precisam cumprir padrões específicos de rotulagem, incluindo códigos de barras 1D e 2D, números de identificação de produtos, bem como requisitos de rotulagem de alérgenos e país de origem.

A tecnologia OCR permite o reconhecimento e interpretação automáticos dessas etiquetas, garantindo a conformidade e possibilitando a rastreabilidade contínua em toda a cadeia de suprimentos, enquanto a aprendizagem profunda ajuda a melhorar a precisão e a confiabilidade do processo de reconhecimento. Isso ajuda as empresas a atenderem aos requisitos regulatórios, aprimorarem o gerenciamento de inventário e melhorarem a eficiência operacional geral.

Benefícios da OCR

O OCR ajuda a melhorar a precisão e a rastreabilidade de pacotes e remessas. Ao ler e interpretar automaticamente etiquetas de envio, os sistemas OCR podem garantir que os pacotes sejam rotulados, classificados e rastreados com precisão em toda a cadeia de suprimentos. Isso reduz as chances de pacotes mal direcionados ou perdidos, levando a uma maior satisfação do cliente e a melhores margens de lucro.

O OCR reconhece e registra automaticamente produtos e números de série — juntamente com códigos de barras 1D e 2D — ou códigos QR em embalagens para permitir um gerenciamento de inventário eficiente. Ao automatizar o rastreamento e a atualização dos níveis de estoque, a tecnologia OCR ajuda a reduzir o esforço manual e o risco de erro humano. Dados precisos do inventário permitem que as empresas otimizem suas operações da cadeia de suprimentos e evitem faltas ou excesso de estoque.

Ao automatizar a extração e o processamento de informações textuais, a OCR contribui para a eficiência operacional geral. Ela permite um processamento mais rápido de documentos, reduz a intervenção manual e acelera os processos de tomada de decisão. Esse ganho de eficiência se traduz em um processamento mais rápido de pedidos, maior precisão nos envios e maior produtividade em várias aplicações de embalagem, envio e logística.

Benefícios
  • Certifique-se de que as embalagens e etiquetas contenham texto preciso/legível
  • Inspecione e leia os códigos de data e lote
  • Melhore as operações de rastreamento e localização
  • Permita o máximo de rendimento nas aplicações de embalagem

Desafios do OCR Tradicional

A OCR evoluiu para enfrentar os desafios apresentados por diversos formatos de embalagem e rotulagem, mas fontes estilizadas, caracteres distorcidos ou ocultos, superfícies refletoras e fundos complexos podem representar dificuldades para as técnicas tradicionais de OCR, que são ensinadas ao usuário e, portanto, normalmente exigem profissionais de imagem industrial para configuração, treinamento e implantação (Figura 1).

Treinar um sistema tradicional de OCR envolve várias etapas. Primeiro, as imagens de entrada são pré-processadas para melhorar sua qualidade e prepará-las para o reconhecimento de caracteres. Isso pode envolver tarefas como redução de ruído, binarização de imagem (conversão para preto e branco) e desalinhamento (ajuste da imagem para corrigir a rotação).

A segmentação é a próxima. A imagem pré-processada é dividida em caracteres individuais ou linhas de texto. Essa etapa separa os caracteres ou linhas uns dos outros, tornando-os mais fáceis de reconhecer e analisar separadamente. Em seguida, as características são extraídas de cada caractere segmentado. Essas características são traços distintivos que ajudam a diferenciar um caractere de outro. Os sistemas tradicionais de OCR usam várias técnicas para extrair características, como analisar os contornos, traços e outras propriedades geométricas dos caracteres. 

Um conjunto de dados de treinamento é criado ao rotular as características extraídas com os seus caracteres correspondentes. Para treinar o sistema OCR de forma eficaz, é necessário um conjunto diversificado de imagens de treinamento que cubram diferentes fontes, tamanhos, estilos, orientações e condições de ruído que o sistema pode encontrar em cenários do mundo real. Operadores humanos anotam manualmente cada caractere nas imagens de treinamento para criar um conjunto de dados que associa as características dos caracteres aos seus rótulos corretos.

Em seguida, vem o treinamento do classificador, onde um algoritmo de classificação é treinado usando os dados de treinamento rotulados. Este algoritmo aprende a reconhecer padrões nas características extraídas e a associá-los aos caracteres correspondentes. Os algoritmos comuns usados em sistemas OCR tradicionais incluem máquinas de vetores de suporte, modelos de Markov ocultos e vizinhos mais próximos k.

Em seguida, o classificador treinado é avaliado usando um conjunto separado de dados de teste. Essa avaliação mede a precisão e o desempenho do sistema OCR. Se o desempenho não for satisfatório, o processo de treinamento pode ser iterado ajustando parâmetros, melhorando técnicas de pré-processamento ou expandindo o conjunto de dados de treinamento.

Uma vez que o sistema OCR atinge o nível de precisão desejado, ele pode ser implantado para reconhecer caracteres em imagens novas e não vistas. A imagem pré-processada é segmentada e o classificador treinado é usado para reconhecer e converter os caracteres segmentados em texto digital. É importante notar que os sistemas OCR tradicionais dependem fortemente de características criadas manualmente e algoritmos específicos, tornando-os menos adaptáveis a diferentes estilos de fonte, tamanhos e idiomas em comparação com sistemas OCR baseados em aprendizado profundo.

5 examples of printed products which are difficult to scan  using Traditional OCR methods due to reflective surfaces, printing on curved surfaces, and characters that are skewed, distorted, or obscured

Figura 1: Métodos OCR tradicionais podem enfrentar desafios ao lidar com superfícies refletoras, impressão em superfícies curvas e caracteres que estão inclinados, distorcidos ou obscurecidos.

Figura 2: Os sistemas OCR tradicionais são ensinados pelos usuários, o que envolve várias etapas, incluindo pré-processamento, segmentação, rotulagem, classificação e avaliação do algoritmo.

Examples of challenging character recognition including complex backgrounds, blurry or damaged characters, distortion, or reflective surfaces that make traditional OCR techniques ineffective.

Figura 3: As capacidades de OCR fornecidas pela ferramenta DL-OCR oferecem uma solução para projetos desafiadores de reconhecimento de caracteres. Esses projetos envolvem contextos complexos, caracteres desfocados ou danificados, distorção ou superfícies refletoras que tornam as técnicas tradicionais de OCR ineficazes. A ferramenta inclui uma rede neural pré-treinada, pronta para uso com milhares de amostras de imagens diversas. Ela atinge aproximadamente 97% de precisão desde o início, mesmo em cenários muito difíceis.

Conheça a Aprendizagem Profunda

A inteligência artificial e a aprendizagem de máquina, e especificamente a aprendizagem profunda, apresentam uma solução promissora para os desafios das soluções de OCR. Com o uso de algoritmos de aprendizagem profunda, torna-se possível detectar irregularidades em padrões — mesmo quando caracteres alfanuméricos são difíceis de definir usando regras rígidas — e avanços estão em andamento para enfrentar esses desafios e melhorar o processo de OCR.

Abordagens modernas, como a OCR baseada em aprendizagem profunda, utilizam redes neurais convolucionais (CNNs) e redes neurais recorrentes (RNNs) para aprender e extrair automaticamente características dos caracteres, reduzindo a dependência de recursos projetados explicitamente. Esses modelos podem lidar com uma variedade mais ampla de fontes e se adaptar de forma mais rápida e eficaz a fontes novas ou desconhecidas sem exigir ajustes manuais extensivos.

O processo de coleta e anotação de grandes conjuntos de dados necessários para treinar modelos de aprendizagem profunda, no entanto, emergiu como um obstáculo à implementação generalizada. O número de imagens necessárias para um conjunto de dados varia de acordo com a complexidade da aplicação de leitura de código , e é frequentemente determinado por meio de experimentação e refinamento iterativo para alcançar o desempenho desejado.

Atualizar o processo de OCR para lidar com mudanças de fonte de forma mais eficiente é uma área contínua de pesquisa e desenvolvimento, visando reduzir o ônus dos ajustes manuais e aprimorar a adaptabilidade do sistema a novas fontes e variações de texto (Figura 3). Para esse fim, técnicas de aprendizagem de transferência também estão sendo empregadas para aproveitar modelos pré-treinados em grandes conjuntos de dados, permitindo uma melhor generalização e reduzindo a necessidade de dados de treinamento excessivos para cada fonte específica.

Ferramenta de OCR da Zebra

Avanços no OCR tornaram possível superar todos esses desafios. Por exemplo, a ferramenta OCR de Aprendizagem Profunda (DL-OCR) de qualidade industrial é um complemento ao software Zebra Aurora Focus™ que torna a leitura de texto rápida e fácil. O DL-OCR vem com uma rede neural pronta para uso, pré-treinada usando milhares de amostras de imagens diferentes. Portanto, ele oferece alta precisão desde o início, mesmo ao lidar com casos muito difíceis. Os usuários podem criar aplicações robustas de OCR em apenas algumas etapas simples — tudo isso sem a necessidade de conhecimento especializado em machine vision (Figura 4). A interface intuitiva do software Zebra Aurora torna a configuração fácil, e o sistema pode ser implementado em apenas alguns minutos.

Ao contrário das aplicações tradicionais de OCR, a Zebra adotou uma abordagem de aprendizado zero com sua ferramenta DL-OCR, que fornece leituras precisas sem a necessidade de treinar diferentes textos ou fontes antecipadamente. A ferramenta também utiliza técnicas de última geração que permitem a leigos configurarem facilmente aplicações rápidas, precisas de reconhecimento de texto e leituras desafiantes. Outra vantagem importante da ferramenta DL-OCR é a sua capacidade de lidar de forma mais eficaz com textos inconsistentes ou com contraste degradado.

Com a nova ferramenta, uma implementação do Aurora Focus DL-OCR pode ser simplificada em poucas etapas rápidas: colocar a região de interesse (ROI) ao redor do texto a ser lido, fixar a ROI a uma ferramenta de localização que facilita a leitura quando a peça se move ou gira dentro do campo de visão da câmera, e ajustar alguns limites que ajudam a diferenciar entre diferentes sequências de caracteres, incluindo tamanho alfanumérico matemático ou espaçamento, conforme necessário.

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Figura 4: Os usuários do DL-OCR da Zebra podem facilmente criar uma aplicação robusta de OCR com apenas algumas etapas simples, sem precisar de amplo conhecimento em visão computacional. 

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Figura 5: Os principais recursos da ferramenta DL-OCR da Zebra incluem a sua prontidão para uso, a capacidade de lidar com casos de OCR difíceis que não são alcançáveis com métodos tradicionais, alta precisão pronta para uso, facilidade de uso e compatibilidade com GPU e CPU da NVIDIA.

Escalabilidade e otimização completas

Como parte do software Aurora da Zebra, a ferramenta DL-OCR pode ser implementada em uma variedade de produtos diferentes, incluindo qualquer scanner industrial fixo FS ou câmera inteligente VS, proporcionando uma implantação na própria câmera que oferece um sistema de inspeção compacto e autocontido. As plataformas de câmera inteligente incorporadas apresentam uma abordagem mais rápida e simples para configurar e capturar imagens para várias aplicações de OCR quando comparadas aos sistemas tradicionais de visão computacional baseados em PC industrial.

No entanto, os usuários finais não estão limitados à implantação da ferramenta apenas em dispositivos da Zebra, pois o software Aurora pode ser implantado de forma confiável em PCs industriais e controladores de visão de terceiros disponíveis no mercado atualmente. Com as necessidades dos clientes em constante expansão e evolução, os usuários finais precisam de ferramentas que não sejam apenas eficazes, mas também fáceis de usar. A nova ferramenta DL-OCR foi projetada com isso em mente, pois não requer treinamento e pode ser implementada em sistemas de borda ou distribuídos, proporcionando aos usuários a flexibilidade necessária para implantar um sistema que atenda exatamente às suas necessidades e que possa ser escalonado e otimizado conforme necessário.

Independentemente da plataforma de hardware selecionada, as ferramentas de aprendizagem profunda oferecem várias vantagens em aplicações de OCR em comparação com os métodos tradicionais de OCR. Os sistemas de DL-OCR, como os da Zebra Technologies, conseguem ler fontes diretamente e continuarão a aprender ainda mais à medida que a equipe da Zebra treina o algoritmo com novas imagens e amostras para as próximas versões do Software. Esta abordagem de aprendizagem completa elimina a necessidade de extração explícita de recursos, tornando o sistema mais adaptável a diversas fontes, idiomas e estilos (Figura 5). Os sistemas tradicionais de OCR exigem recursos criados manualmente, o que pode ser menos flexível de implementar e demorado de manter.

4SightXV6

Zebra VS40 machine vision smart sensor

Câmera inteligente de visão de máquina VS40

Conclusão


Os modelos de aprendizagem profunda demonstraram desempenho superior em tarefas de reconhecimento de caracteres. Eles conseguem aprender e identificar automaticamente padrões complexos, tornando-os altamente eficazes no manuseio de variações em caracteres, ruídos e distorções. Os modelos de aprendizagem profunda frequentemente alcançam taxas de precisão mais altas em comparação com os métodos tradicionais de OCR, economizando tempo e dinheiro para fabricantes e integradores, ao mesmo tempo em que permitem um OCR que pode lidar de forma mais eficaz com textos que podem ser inconsistentes ou ter contraste degradado.

 

Implementar a aprendizagem profunda em aplicações de OCR não precisa ser difícil. O DL-OCR da Zebra traz vantagens significativas para a automação de processos de embalagem, envio e logística, oferecendo uma solução de OCR fácil de implementar que pode ser configurada em minutos e lidar efetivamente com desafios como varredura automatizada de pacotes, classificação e tarefas de rotulagem, melhorando a precisão, a rastreabilidade e a conformidade com os padrões de rotulagem.

 

Para mais informações sobre a ferramenta DL-OCR da Zebra e o Software de Visão de Máquina, clique abaixo.