Derin Öğrenme: Zorlu Karakter Tanıma Projeleri İçin Cevap


Derin öğrenme OCR, paketleme, gönderim ve lojistik uygulamalarında zorlu karakter tanıma projelerini basitleştirir.

DPM code on an automotive part being read by a ZebraFS42 scanner

Giriş

E-ticaret ve küresel ticaret büyümesi, taşınan malların hacmini önemli ölçüde artırır. Paketleme, gönderim ve lojistik otomasyonunun giderek daha önemli hale gelmesinin bir nedeni budur. Otomasyon, şirketlerin ürünleri daha hızlı ve daha doğru paketlemesine yardımcı olur, paket ayrıştırma ve işleme süreçlerini iyileştirir, depo yönetimi ve taşımacılığı geliştirir, böylece işletmelerin daha verimli çalışmasına, müşteri beklentilerini karşılamasına ve günümüzün hızlı tempolu, hızla gelişen pazarında rekabetçi kalmasına olanak tanır.

Makinaların görüntülerden metin tanıyıp çıkarmasına olanak tanıyan bir teknoloji olan optik karakter tanıma (OCR), paketleri tarayan, ayıran ve etiketleyen otomatik sistemlerde önemli bir rol oynar. Yazılı veya el yazısı metni sevkiyat etiketlerinden veya belgelerden hızla dijital verilere dönüştürerek, OCR manuel veri girişine olan ihtiyacı ortadan kaldırır, hataları azaltır ve zaman tasarrufu sağlar.

OCR her ne kadar ilerlemeye devam etse ve çeşitli paketleme ve etiketleme formatlarını ele alabilse de, stilize yazı tipleri, bozuk veya gizli karakterler, yansıtıcı yüzeyler ve karmaşık arka planlar yalnızca derin öğrenme (DL) ile ele alınabilecek bir zorluk olmaya devam etmektedir.

Üretim, paketleme ve sıralama hatlarının hızı artarak daha yüksek talepleri karşılamaya çalıştıkça, etiketleme gereklilikleri ve düzenlemeleri de artmaktadır. Paketler ve gönderiler, 1D ve 2D barkodlar, ürün kimlik saptama numaraları, alerjen ve menşei ülke etiketleme gereklilikleri dahil olmak üzere belirli etiketleme standartlarına uymalıdır.

OCR teknolojisi, bu etiketlerin otomatik olarak tanınmasını ve yorumlanmasını sağlar, uyumluluğu güvence altına alır ve tedarik zinciri genelinde sorunsuz izlenebilirlik sağlar, derin öğrenme ise tanıma sürecinin doğruluğunu ve güvenilirliğini artırmaya yardımcı olur. Bu, şirketlerin yasal gereklilikleri karşılamalarına, envanter yönetimini geliştirmelerine ve genel operasyonel verimliliği artırmalarına yardımcı olur.

OCR Faydaları

OCR, paketlerin ve gönderilerin doğruluğunu ve izlenebilirliğini artırmaya yardımcı olur. Otomatik olarak gönderi etiketlerini okuyup yorumlayarak, OCR sistemleri paketlerin tedarik zinciri boyunca doğru şekilde etiketlenmesini, sıralanmasını ve izlenmesini sağlayabilir. Bu, yanlış yönlendirilmiş veya kaybolmuş paketlerin olasılığını azaltarak, müşteri memnuniyetini artırır ve kâr marjlarını iyileştirir.

OCR, envanterin etkin yönetimini sağlamak için ürünleri ve seri numaralarını—1B ve 2B barkodlar veya ambalaj üzerindeki QR kodlarıyla birlikte—otomatik olarak tanır ve kaydeder. Stok seviyelerinin izlenmesini ve güncellenmesini otomatikleştirerek, OCR teknolojisi manuel çabayı ve insan hatası riskini azaltmaya yardımcı olur. Doğru envanter verileri, işletmelerin tedarik zinciri operasyonlarını optimize etmelerini ve stok tükenmesi veya aşırı stoklamadan kaçınmalarını sağlar.

Metin bilgilerini çıkarmayı ve işlemeyi otomatikleştirerek, OCR genel operasyonel verimliliğe katkıda bulunur. Daha hızlı belge işlemeyi sağlar, manuel müdahaleyi azaltır ve karar verme süreçlerini hızlandırır. Bu verimlilik artışı, daha hızlı sipariş işleme, gelişmiş sevkiyat doğruluğu ve çeşitli paketleme, nakliye ve lojistik uygulamalarında artırılmış üretkenlik şeklinde kendini gösterir.

Avantajlar
  • Paketleme ve etiketlerin doğru/okunaklı metin içerdiğinden emin olun
  • Tarih ve parti kodlarını inceleyin ve okuyun
  • İzleme ve takip operasyonlarını iyileştirin
  • Ambalaj uygulamaları için maksimum verimi etkinleştirin

Geleneksel OCR Zorlukları

OCR, çeşitli ambalaj ve etiketleme formatlarının getirdiği zorluklara yanıt verecek şekilde gelişmiştir, ancak stilize yazı tipleri, bozulmuş veya gizlenmiş karakterler, yansıtıcı yüzeyler ve karmaşık arka planlar, kullanıcı tarafından öğretilen ve bu nedenle genellikle kurulum, eğitim ve dağıtım için endüstriyel görüntü profesyonelleri gerektiren geleneksel OCR teknikleri için zorluklar oluşturabilir (Şekil 1).

Geleneksel bir OCR sisteminin eğitimi birkaç adım içerir. İlk olarak, girdili görüntüler kaliteyi artırmak ve karakter tanımasına hazırlamak için ön işleme tabi tutulur. Bu, gürültü azaltma, görüntü ikili hale getirme (siyah beyaza dönüştürme) ve döndürme düzeltme (görüntüyü döndürmeyi düzeltmek için ayarlama) gibi görevleri içerebilir.

Sonraki adım bölümleme. Ön işlenmiş görüntü, bireysel karakterlere veya metin satırlarına bölünür. Bu adım, karakterleri veya satırları birbirinden ayırır, böylece onları tanımayı ve ayrı ayrı analiz etmeyi kolaylaştırır. Daha sonra her bölümlenmiş karakterden özellikler çıkarılır. Bu özellikler, bir karakteri diğerinden ayırmaya yardımcı olan ayırt edici özelliklerdir. Geleneksel OCR sistemleri, konturlar, çizgiler ve karakterlerin diğer geometrik özelliklerini analiz etme gibi çeşitli teknikler kullanarak özellik çıkarır. 

Çıkarılan özelliklerin karşılık gelen karakterlerle etiketlenmesiyle bir eğitim veri seti oluşturulur. OCR sistemini etkili bir şekilde eğitmek için, sistemin gerçek dünya senaryolarında karşılaşabileceği farklı yazı tiplerini, boyutları, stilleri, yönleri ve gürültü koşullarını kapsayan çeşitli eğitim görüntüleri gereklidir. İnsan operatörler, eğitim görüntülerindeki her karakteri elle açıklayarak, karakter özelliklerini doğru etiketleriyle eşleştiren bir veri seti oluşturur.

Sonra sınıflandırıcı eğitimi gelir, burada etiketlenmiş eğitim verileri kullanılarak bir sınıflandırma algoritması eğitilir. Bu algoritma, çıkarılan özelliklerdeki kalıpları tanımayı öğrenir ve bunları karşılık gelen karakterlerle ilişkilendirir. Geleneksel OCR sistemlerinde kullanılan yaygın algoritmalar arasında destek vektör makineleri, gizli Markov modelleri ve en yakın komşu algoritmaları bulunur.

Ardından, eğitilmiş sınıflandırıcı, ayrı bir test veri seti kullanılarak değerlendirilir. Bu değerlendirme, OCR sisteminin doğruluğunu ve performansını ölçer. Performans tatmin edici değilse, parametreleri ayarlayarak, ön işleme tekniklerini geliştirerek veya eğitim veri setini genişleterek eğitim süreci tekrarlanabilir.

OCR sistemi istenen doğruluk seviyesine ulaştığında, yeni, görülmemiş görüntülerdeki karakterleri tanımak için kullanılabilir. Önceden işlenmiş görüntü segmentlere ayrılır ve eğitilmiş sınıflandırıcı, segmentlere ayrılmış karakterleri tanımak ve dijital metne dönüştürmek için kullanılır. Geleneksel OCR sistemlerinin yoğun bir şekilde el yapımı özelliklere ve belirli algoritmalara dayandığını belirtmek önemlidir; bu da onları derin öğrenmeye dayalı OCR sistemlerine kıyasla farklı yazı tipi stillerine, boyutlarına ve dillere daha az uyarlanabilir hale getirir.

5 examples of printed products which are difficult to scan  using Traditional OCR methods due to reflective surfaces, printing on curved surfaces, and characters that are skewed, distorted, or obscured

Şekil 1: Geleneksel OCR yöntemleri, yansıtıcı yüzeylerle, eğimli yüzeylere baskı yapıldığında ve eğilmiş, bozulmuş veya gizlenmiş karakterlerle çalışırken zorluklarla karşılaşabilir.

Şekil 2: Geleneksel OCR sistemleri kullanıcı tarafından öğretilir; bu, ön işleme, parçalama, etiketleme, sınıflandırma ve algoritma değerlendirmesi gibi birkaç adım içerir.

Examples of challenging character recognition including complex backgrounds, blurry or damaged characters, distortion, or reflective surfaces that make traditional OCR techniques ineffective.

Şekil 3: DL-OCR aracının sağladığı OCR yetenekleri, zorlu karakter tanıma projeleri için bir çözüm sunar. Bu projeler, geleneksel OCR tekniklerini etkisiz kılan, karmaşık arka planlara, bulanık veya hasarlı karakterlere, bozulmaya veya yansıtıcı yüzeylere sahiptir. Araç, binlerce çeşitli görüntü örneği ile kullanılmaya hazır, önceden eğitilmiş bir sinirsel ağ içerir. En başından itibaren, çok zor senaryolarda bile yaklaşık %97 doğruluk sağlar.

Derin Öğrenme Sahneye Çıkıyor

Yapay zeka ve makine öğrenimi, özellikle derin öğrenme, OCR çözümlerinin karşılaştığı zorluklar için umut verici bir çözüm sunmaktadır. Derin öğrenme algoritmalarının kullanımıyla, alfasayısal karakterlerin katı kurallarla tanımlanmasının zor olduğu durumlarda bile, desenlerdeki düzensizlikleri tespit etmek mümkün hale gelir ve bu zorlukların üstesinden gelmek ve OCR sürecini iyileştirmek için gelişmeler devam etmektedir. 

Derin öğrenme tabanlı OCR gibi modern yaklaşımlar, karakterlerden özellikleri otomatik olarak öğrenmek ve çıkarmak için evrişimli sinirsel ağlar (CNN'ler) ve yinelemeli sinirsel ağlar (RNN'ler) kullanarak açıkça tasarlanmış özelliklere bağımlılığı azaltır. Bu modeller, daha geniş bir yazı tipi çeşitliliğini yönetebilir ve yeni veya tanıdık olmayan yazı tiplerine daha hızlı ve daha etkili bir şekilde uyarlanabilir, geniş kapsamlı manuel ayarlamalar gerektirmeden.

Derin öğrenme modelleri için gerekli büyük veri setlerini toplama ve açıklama süreci, ancak, yaygın uygulama için bir engel olarak ortaya çıkmıştır. Bir veri seti için gereken görüntü sayısı, kod okuma uygulamasının karmaşıklığına göre değişir ve genellikle arzulanan performansa ulaşmak için deneyler ve tekrarlayan iyileştirmeler yoluyla belirlenir.

OCR sürecini yazı tipi değişikliklerini daha verimli bir şekilde ele alacak şekilde güncellemek, manuel ayarlamaların yükünü azaltmak ve sistemin yeni yazı tipleri ve metin varyasyonlarına uyum yeteneğini artırmayı amaçlayan devam eden bir araştırma ve geliştirme alanıdır (Şekil 3). Bu doğrultuda, transfer öğrenme teknikleri, büyük veri setleri üzerinde önceden eğitilmiş modellerden yararlanmak için de kullanılmakta, bu da daha iyi genelleme sağlamakta ve her bir özel font için aşırı eğitim verilerine olan ihtiyacı azaltmaktadır.

Zebra’nın Derin Öğrenme OCR Aracı

OCR'deki ilerlemeler, tüm bu zorlukların üstesinden gelinmesini mümkün kılmıştır. Örneğin, endüstriyel kalite Derin Öğrenme OCR (DL-OCR) aracı, metin okuma işlemini hızlı ve kolay hale getiren Zebra Aurora Focus™ yazılımına eklenen bir ektir. DL-OCR, binlerce farklı görüntü örneği kullanılarak önceden eğitilmiş, kullanıma hazır bir sinirsel ağ ile birlikte gelir. Bu nedenle, çok zor durumlarla karşılaşsa bile kutudan çıktığı haliyle yüksek doğruluk sağlar. Kullanıcılar, makine görüşü uzmanlığına ihtiyaç duymadan yalnızca birkaç basit adımda sağlam OCR uygulamaları oluşturabilirler (Şekil 4). Sezgisel Zebra Aurora Focus yazılımı arayüzü kurulumunu kolaylaştırır ve sistem sadece birkaç dakika içinde devreye alınabilir.

Geleneksel OCR uygulamalarının aksine, Zebra'nın DL-OCR aracı, farklı metin veya yazı tiplerini önceden eğitmeye gerek kalmadan doğru okuma sağlayan sıfır öğrenme yaklaşımını benimsemiştir. Araç ayrıca, yeni başlayanların hızlı, doğru metin tanıma ve zorlu okuma uygulamalarını kolaylıkla kurmasına olanak tanıyan en son tekniklerden yararlanmaktadır. DL-OCR aracının bir diğer önemli avantajı, tutarsız veya kontrastı bozulmuş metinlerle daha etkili bir şekilde başa çıkabilme yeteneğidir.

Yeni araçla, bir Aurora Focus DL-OCR kurulumunu şu hızlı adımlarla basitleştirmek mümkündür: okunan metnin etrafına ilgilenilen bölgeyi (ROI) yerleştirmek, parçanın kamera görüş alanı içinde hareket ettiğinde veya döndüğünde okumayı kolaylaştıran bir konumlandırma aracına ROI'yi yerleştirmek ve gerektiğinde matematiksel, alfanümerik boyut veya boşluk dahil farklı karakter dizilerini ayırt etmeye yardımcı olacak birkaç eşiği ayarlamak.

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Şekil 4: Zebra DL-OCR kullanıcıları, geniş kapsamlı makine görüşü uzmanlığına sahip olmadan, yalnızca birkaç basit adımla sağlam bir OCR uygulaması kolayca oluşturabilirler. 

Optical character recognition OCR scan examples of difficult product labels using Deep Learning OCR

Şekil 5: Zebra'nın DL-OCR aracının temel özellikleri, kullanım kolaylığı, geleneksel yöntemlerle elde edilemeyen zor OCR vakalarını yönetebilmesi, kutudan çıktığı anda yüksek doğruluk, kullanıcı dostu olması ve hem NVIDIA GPU hem de CPU ile uyumluluğu içerir.

Tam Ölçeklenebilirlik ve Optimizasyon

Zebra'nın Aurora yazılımının bir parçası olarak, DL-OCR aracı, herhangi bir FS sabit endüstriyel tarayıcı veya VS akıllı kamera dahil olmak üzere çeşitli ürünlerde dağıtılabilir, kompakt, kendi kendine yeterli bir inceleme sistemi sunan kamera üzerinde dağıtım sağlar. Gömülü akıllı kamera platformları, geleneksel endüstriyel PC tabanlı machine vision sistemlerine kıyasla, çeşitli OCR uygulamaları için kurulum ve görüntü yakalama konusunda daha hızlı ve daha basit bir yaklaşım sunar.

Ancak, son kullanıcılar aracı yalnızca Zebra cihazlarında kullanmakla sınırlı değildir, çünkü Aurora yazılımı günümüzde piyasada bulunan üçüncü taraf endüstriyel PC'ler ve görüntü kontrolörlerinde güvenilir bir şekilde kullanılabilir. Müşteri ihtiyaçlarının sürekli genişlemesi ve gelişmesiyle, son kullanıcıların yalnızca etkili değil aynı zamanda kolay kullanılabilir araçlara ihtiyacı vardır. Yeni DL-OCR aracı bu düşünceyle tasarlandı, çünkü herhangi bir eğitim gerektirmez ve uçlarda veya dağıtık sistemlerde kullanılabilir, kullanıcılara tam ihtiyaçlarını karşılayan ve gerektiği gibi ölçeklendirip optimize edebilecekleri bir sistemi kullanma esnekliği sunar.

Seçilen donanım platformuna bakılmaksızın, derin öğrenme araçları, OCR uygulamalarında geleneksel OCR yöntemlerine kıyasla çeşitli avantajlar sunar. Zebra Technologies'ten gelen DL-OCR sistemleri, kutudan çıkar çıkmaz yazı tiplerini okuyabilir ve algoritmanın yeni görüntüler ve örneklerle eğitilmesiyle birlikte yeni yazılım sürümleri için daha fazla öğrenmeye devam edecektir. Bu uçtan uca öğrenme yaklaşımı, açıkça özellik çıkarımı gereksinimini ortadan kaldırarak sistemi çeşitli yazı tiplerine, dillere ve stillere daha uyumlu hale getirir (Şekil 5). Geleneksel OCR sistemleri, uygulanması daha az esnek ve sürdürülmesi zaman alıcı olabilen el yapımı özellikler gerektirir.

4SightXV6

Zebra VS40 machine vision smart sensor

VS40 Machine Vision Akıllı Kamera

Sonuç


Derin öğrenme modelleri karakter tanıma görevlerinde üstün performans sergilemiştir. Bunlar karmaşık desenleri otomatik olarak öğrenip tanıyabilir, bu da onları karakterlerdeki, gürültüdeki ve bozulmadaki değişiklikleri işlemede son derece etkili kılar. Derin öğrenme modelleri genellikle geleneksel OCR yöntemlerine kıyasla daha yüksek doğruluk oranlarına ulaşır; üreticilere ve entegratörlere zaman ve para kazandırırken, tutarsız veya kontrastı azalmış metinle daha etkili başa çıkabilen OCR'yi mümkün kılar.

 

Derin öğrenmenin OCR uygulamalarında kullanılması zor olmak zorunda değildir. Zebra DL-OCR, paketleme, gönderim ve lojistik süreçlerinin otomasyonuna önemli avantajlar sunar; birkaç dakika içinde kurulabilen, otomatik paket tarama, sıralama ve etiketleme görevleri gibi zorlukları etkili bir şekilde çözebilirken doğruluk, izlenebilirlik ve etiketleme standartlarına uyumu iyileştiren bir kolay OCR çözümü sunar.

 

Zebra'nın DL-OCR aracı ve makine görüşü yazılımı hakkında daha fazla bilgi için aşağıya tıklayın.