딥 러닝: 까다로운 문자 인식 프로젝트를 위한 솔루션


딥 러닝 OCR은 포장, 배송 및 물류 애플리케이션에서 까다로운 문자 인식 프로젝트를 간소화합니다.

DPM code on an automotive part being read by a ZebraFS42 scanner

소개

전자상거래와 글로벌 무역 성장은 운송되는 상품의 양을 크게 증가시킵니다. 이것이 포장, 배송 및 물류 분야의 자동화가 점점 더 중요해지는 이유 중 하나입니다. 자동화는 또한 기업이 제품을 더 빠르고 정확하게 포장하고, 패키지 분류 및 처리를 개선하며, 창고 관리 및 운송을 향상시켜 비즈니스가 더 효율적으로 운영되고, 고객 기대를 충족하며, 오늘날 빠르게 변화하는 시장에서 경쟁력을 유지할 수 있도록 지원합니다.

광학 문자 인식(OCR)은 기계가 이미지에서 텍스트를 인식하고 추출할 수 있게 하는 기술로, 패키지를 스캔하고 분류하며 라벨을 부착하는 자동화 시스템에서 중요한 역할을 합니다. 배송 라벨이나 문서의 인쇄 또는 손으로 쓴 텍스트를 디지털 데이터로 빠르게 변환함으로써 OCR은 수동 데이터 입력의 필요성을 없애고 오류를 줄이며 시간을 절약합니다.

OCR은 계속 발전하여 다양한 포장 및 라벨 형식을 처리할 수 있지만, 양식화된 글꼴, 왜곡되거나 가려진 문자, 반사 표면 및 복잡한 배경은 딥 러닝(DL)으로만 해결할 수 있는 과제로 남아 있습니다.

증가하는 수요를 충족하기 위해 생산, 포장 및 분류 라인 속도가 증가함에 따라 라벨 요구 사항과 규정도 증가합니다. 패키지와 배송품은 1D 및 2D 바코드, 제품 식별 번호, 알레르기 유발 물질 및 원산지 라벨 요구 사항을 포함한 특정 라벨 표준을 준수해야 합니다.

OCR 기술은 이러한 라벨의 자동 인식 및 해석을 가능하게 하여 규정 준수를 보장하고 공급망 전반에 걸쳐 원활한 추적성을 지원하며, 딥 러닝은 인식 프로세스의 정확성과 신뢰성을 향상시킵니다. 이를 통해 기업은 규제 요구 사항을 충족하고 재고 관리를 강화하며 전반적인 운영 효율성을 개선할 수 있습니다.

OCR의 이점

OCR은 패키지와 배송품의 정확성과 추적성을 개선하는 데 도움이 됩니다. 배송 라벨을 자동으로 읽고 해석함으로써 OCR 시스템은 패키지가 공급망 전반에 걸쳐 정확하게 라벨이 부착되고 분류되며 추적되도록 보장할 수 있습니다. 이는 잘못 배송되거나 분실된 패키지의 가능성을 줄여 고객 만족도를 높이고 수익률을 개선합니다.

OCR은 포장의 제품 및 일련 번호와 함께 1D 및 2D 바코드 또는 QR Code를 자동으로 인식하고 기록하여 효율적인 재고 관리를 지원합니다. 재고 수준의 추적 및 업데이트를 자동화함으로써 OCR 기술은 수동 작업과 인적 오류의 위험을 줄이는 데 도움이 됩니다. 정확한 재고 데이터를 통해 기업은 공급망 운영을 최적화하고 재고 부족이나 과잉 재고를 방지할 수 있습니다.

텍스트 정보의 추출 및 처리를 자동화함으로써 OCR은 전반적인 운영 효율성에 기여합니다. 더 빠른 문서 처리를 가능하게 하고, 수동 개입을 줄이며, 의사 결정 프로세스를 가속화합니다. 이러한 효율성 향상은 더 빠른 주문 처리, 향상된 배송 정확성 및 다양한 포장, 배송 및 물류 애플리케이션 전반에 걸친 생산성 향상으로 이어집니다.

이점
  • 포장 및 라벨에 정확하고 읽기 쉬운 텍스트가 포함되어 있는지 확인
  • 날짜 및 로트 코드 검사 및 판독
  • 추적 및 추적 작업 개선
  • 포장 애플리케이션의 최대 처리량 지원

기존 OCR의 과제

OCR은 다양한 포장 및 라벨 형식이 제시하는 과제를 해결하도록 발전했지만, 양식화된 글꼴, 왜곡되거나 가려진 문자, 반사 표면 및 복잡한 배경은 사용자가 학습시키는 기존 OCR 기술에 어려움을 줄 수 있으며, 따라서 일반적으로 설정, 학습 및 배포를 위해 산업용 이미징 전문가가 필요합니다(그림 1).

기존 OCR 시스템을 학습시키는 과정은 여러 단계로 이루어집니다. 먼저 입력 이미지를 전처리하여 품질을 향상시키고 문자 인식을 위해 준비합니다. 여기에는 노이즈 감소, 이미지 이진화(흑백으로 변환) 및 기울기 보정(회전을 보정하기 위해 이미지 조정)과 같은 작업이 포함될 수 있습니다.

다음은 분할입니다. 전처리된 이미지는 개별 문자 또는 텍스트 라인으로 나뉩니다. 이 단계에서는 문자 또는 라인을 서로 분리하여 개별적으로 인식하고 분석하기 쉽게 만듭니다. 그런 다음 분할된 각 문자에서 특징이 추출됩니다. 이러한 특징은 한 문자를 다른 문자와 구별하는 데 도움이 되는 고유한 특성입니다. 기존 OCR 시스템은 문자의 윤곽, 획 및 기타 기하학적 속성을 분석하는 등 다양한 기술을 사용하여 특징을 추출합니다. 

추출된 특징에 해당 문자를 레이블링하여 훈련 데이터 세트를 생성합니다. OCR 시스템을 효과적으로 훈련하려면 실제 시나리오에서 시스템이 접할 수 있는 다양한 글꼴, 크기, 스타일, 방향 및 노이즈 조건을 포괄하는 다양한 훈련 이미지 세트가 필요합니다. 사람 운영자가 훈련 이미지의 각 문자를 수동으로 주석 처리하여 문자 특징과 올바른 레이블을 쌍으로 연결하는 데이터 세트를 생성합니다.

그런 다음 레이블이 지정된 훈련 데이터를 사용하여 분류 알고리즘을 훈련하는 분류기 훈련이 진행됩니다. 이 알고리즘은 추출된 특징에서 패턴을 인식하고 이를 해당 문자와 연결하는 방법을 학습합니다. 기존 OCR 시스템에서 사용되는 일반적인 알고리즘에는 서포트 벡터 머신, 은닉 마르코프 모델 및 k-최근접 이웃이 포함됩니다.

다음으로, 훈련된 분류기는 별도의 테스트 데이터 세트를 사용하여 평가됩니다. 이 평가는 OCR 시스템의 정확도와 성능을 측정합니다. 성능이 만족스럽지 않으면 매개변수를 조정하거나, 전처리 기술을 개선하거나, 훈련 데이터 세트를 확장하여 훈련 프로세스를 반복할 수 있습니다.

OCR 시스템이 원하는 수준의 정확도를 달성하면 새로운 미확인 이미지에서 문자를 인식하는 데 배포할 수 있습니다. 전처리된 이미지가 분할되고 훈련된 분류기를 사용하여 분할된 문자를 인식하고 디지털 텍스트로 변환합니다. 기존 OCR 시스템은 수작업으로 만든 특징과 특정 알고리즘에 크게 의존하므로 딥러닝 기반 OCR 시스템에 비해 다양한 글꼴 스타일, 크기 및 언어에 대한 적응력이 떨어진다는 점을 유의해야 합니다.

5 examples of printed products which are difficult to scan  using Traditional OCR methods due to reflective surfaces, printing on curved surfaces, and characters that are skewed, distorted, or obscured

그림 1: 기존 OCR 방법은 반사 표면, 곡면 인쇄, 기울어지거나 왜곡되거나 가려진 문자를 처리할 때 어려움을 겪을 수 있습니다.

그림 2: 기존 OCR 시스템은 사용자가 학습시키는 방식으로, 전처리, 분할, 레이블링, 분류 및 알고리즘 평가를 포함한 여러 단계가 필요합니다.

Examples of challenging character recognition including complex backgrounds, blurry or damaged characters, distortion, or reflective surfaces that make traditional OCR techniques ineffective.

그림 3: DL-OCR 도구가 제공하는 OCR 기능은 까다로운 문자 인식 프로젝트를 위한 솔루션을 제공합니다. 이러한 프로젝트에는 복잡한 배경, 흐릿하거나 손상된 문자, 왜곡 또는 반사 표면이 포함되어 기존 OCR 기술이 효과적이지 않습니다. 이 도구에는 수천 개의 다양한 이미지 샘플로 사용할 준비가 된 사전 훈련된 신경망이 포함되어 있습니다. 매우 어려운 시나리오에서도 처음부터 약 97%의 정확도를 달성합니다.

딥러닝의 등장

인공 지능과 머신 러닝, 특히 딥러닝은 OCR 솔루션의 과제에 대한 유망한 해결책을 제시합니다. 딥러닝 알고리즘을 사용하면 영숫자 문자를 엄격한 규칙으로 정의하기 어려운 경우에도 패턴의 불규칙성을 감지할 수 있으며, 이러한 과제를 해결하고 OCR 프로세스를 개선하기 위한 발전이 진행 중입니다. 

딥러닝 기반 OCR과 같은 최신 접근 방식은 합성곱 신경망(CNN)과 순환 신경망(RNN)을 활용하여 문자에서 특징을 자동으로 학습하고 추출함으로써 명시적으로 설계된 특징에 대한 의존도를 줄입니다. 이러한 모델은 더 다양한 글꼴을 처리할 수 있으며 광범위한 수동 조정 없이도 새롭거나 익숙하지 않은 글꼴에 더 빠르고 효과적으로 적응할 수 있습니다.

그러나 딥러닝 모델 훈련에 필요한 대규모 데이터 세트를 수집하고 주석 처리하는 프로세스가 광범위한 구현에 장애물로 등장했습니다. 데이터 세트에 필요한 이미지 수는 코드 판독 애플리케이션의 복잡성에 따라 다르며, 원하는 성능을 달성하기 위해 실험과 반복적인 개선을 통해 결정되는 경우가 많습니다.

글꼴 변경을 보다 효율적으로 처리하도록 OCR 프로세스를 업데이트하는 것은 진행 중인 연구 및 개발 영역으로, 수동 조정의 부담을 줄이고 새로운 글꼴 및 텍스트 변형에 대한 시스템의 적응력을 향상시키는 것을 목표로 합니다(그림 3). 이를 위해 전이 학습 기법도 활용되어 대규모 데이터셋에서 사전 학습된 모델을 활용함으로써 더 나은 일반화를 가능하게 하고 각 특정 글꼴에 대한 과도한 학습 데이터의 필요성을 줄이고 있습니다.

Zebra의 딥러닝 OCR 도구

OCR의 발전으로 이러한 모든 과제를 극복할 수 있게 되었습니다. 예를 들어, 산업용 품질의 딥러닝 OCR(DL-OCR) 도구는 Zebra Aurora Focus™ 소프트웨어의 애드온으로, 텍스트 판독을 빠르고 쉽게 만들어줍니다. DL-OCR은 수천 개의 다양한 이미지 샘플을 사용하여 사전 학습된 신경망을 바로 사용할 수 있도록 제공합니다. 따라서 매우 어려운 경우에도 즉시 높은 정확도를 제공합니다. 사용자는 머신 비전 전문 지식 없이도 몇 가지 간단한 단계만으로 강력한 OCR 애플리케이션을 만들 수 있습니다(그림 4). 직관적인 Zebra Aurora Focus 소프트웨어 인터페이스로 설정이 쉬우며, 시스템은 단 몇 분 만에 배포할 수 있습니다.

기존 OCR 애플리케이션과 달리 Zebra는 DL-OCR 도구에 제로 러닝 접근 방식을 적용하여 사전에 다양한 텍스트나 글꼴을 학습시킬 필요 없이 정확한 판독을 제공합니다. 이 도구는 또한 초보자도 빠르고 정확한 텍스트 인식 및 까다로운 판독 애플리케이션을 쉽게 설정할 수 있도록 하는 최첨단 기술을 활용합니다. DL-OCR 도구의 또 다른 주요 장점은 일관성이 없거나 대비가 저하된 텍스트를 더 효과적으로 처리할 수 있다는 것입니다.

새로운 도구를 사용하면 Aurora Focus DL-OCR 배포를 몇 가지 간단한 단계로 간소화할 수 있습니다. 판독할 텍스트 주위에 관심 영역(ROI)을 배치하고, 부품이 카메라 시야 내에서 이동하거나 회전할 때 판독을 용이하게 하는 위치 지정 도구에 ROI를 고정하며, 수학적, 영숫자 크기 또는 필요에 따른 간격을 포함한 다양한 문자열을 구분하는 데 도움이 되는 몇 가지 임계값을 조정하는 것입니다.

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

그림 4: Zebra DL-OCR 사용자는 광범위한 머신 비전 전문 지식 없이도 몇 가지 간단한 단계만으로 강력한 OCR 애플리케이션을 쉽게 만들 수 있습니다. 

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

그림 5: Zebra DL-OCR 도구의 주요 기능으로는 즉시 사용 가능, 기존 방법으로는 달성할 수 없는 어려운 OCR 사례 처리 능력, 즉시 제공되는 높은 정확도, 사용자 친화성, NVIDIA GPU 및 CPU 모두와의 호환성이 있습니다.

완벽한 확장성 및 최적화

Zebra Aurora 소프트웨어의 일부인 DL-OCR 도구는 모든 FS 고정식 산업용 스캐너 또는 VS 스마트 카메라를 포함한 다양한 제품에 배포할 수 있으며, 컴팩트하고 독립적인 검사 시스템을 제공하는 온카메라 배포를 제공합니다. 임베디드 스마트 카메라 플랫폼은 기존 산업용 PC 기반 머신 비전 시스템과 비교할 때 다양한 OCR 애플리케이션을 위한 이미지 설정 및 캡처에 더 빠르고 간단한 접근 방식을 제공합니다.

그러나 최종 사용자는 Zebra 장치에만 도구를 배포하는 것에 국한되지 않습니다. Aurora 소프트웨어는 현재 시장에서 구할 수 있는 타사 산업용 PC 및 비전 컨트롤러에 안정적으로 배포할 수 있기 때문입니다. 고객의 요구가 지속적으로 확대되고 진화함에 따라 최종 사용자는 효과적일 뿐만 아니라 사용하기 쉬운 도구가 필요합니다. 새로운 DL-OCR 툴은 이러한 점을 염두에 두고 설계되었으며, 학습이 필요 없고 엣지 또는 분산 시스템에 배포할 수 있어 사용자에게 정확한 요구 사항을 충족하는 시스템을 배포하고 필요에 따라 확장 및 최적화할 수 있는 유연성을 제공합니다.

선택한 하드웨어 플랫폼에 관계없이 딥러닝 툴은 기존 OCR 방식에 비해 OCR 애플리케이션에서 여러 가지 이점을 제공합니다. Zebra Technologies의 DL-OCR 시스템과 같은 시스템은 별도 설정 없이 바로 폰트를 읽을 수 있으며, Zebra 팀이 후속 소프트웨어 릴리스를 위해 새로운 이미지와 샘플로 알고리즘을 학습시킴에 따라 지속적으로 더 많은 것을 학습합니다. 이러한 엔드투엔드 학습 접근 방식은 명시적인 특징 추출의 필요성을 제거하여 시스템이 다양한 폰트, 언어 및 스타일에 더 잘 적응할 수 있도록 합니다(그림 5). 기존 OCR 시스템은 수작업으로 만든 특징이 필요하므로 구현 유연성이 떨어지고 유지 관리에 시간이 많이 소요될 수 있습니다.

4SightXV6

Zebra VS40 machine vision smart sensor

VS40 스마트 비전 카메라

결론


딥러닝 모델은 문자 인식 작업에서 뛰어난 성능을 입증했습니다. 복잡한 패턴을 자동으로 학습하고 식별할 수 있어 문자의 변형, 노이즈 및 왜곡을 처리하는 데 매우 효과적입니다. 딥러닝 모델은 기존 OCR 방식에 비해 더 높은 정확도를 달성하는 경우가 많아 제조업체와 통합업체의 시간과 비용을 절감하는 동시에 일관성이 없거나 대비가 저하된 텍스트를 보다 효과적으로 처리할 수 있는 OCR을 구현합니다.

 

OCR 애플리케이션에 딥러닝을 배포하는 것이 어려울 필요는 없습니다. Zebra DL-OCR은 포장, 배송 및 물류 프로세스 자동화에 상당한 이점을 제공하며, 몇 분 안에 설정할 수 있는 배포하기 쉬운 OCR 솔루션을 제공하여 자동화된 패키지 스캐닝, 분류 및 라벨링 작업과 같은 과제를 효과적으로 해결하는 동시에 정확성, 추적성 및 라벨링 표준 준수를 개선합니다.

 

Zebra의 DL-OCR 툴 및 머신 비전 소프트웨어에 대한 자세한 내용을 보려면 아래를 클릭하세요.