Çoklu JPEG'den TXT'ye (OCR)

OCR kullanarak birden fazla JPEG görselinden toplu metin çıkarın. Fotoğraf dizilerindeki metni tek, indirilebilir bir TXT dosyasında birleştirin.

Doğru alfabenin tanınması için metnin dilini seçin. Otomatik mod her sayfadaki alfabeyi kendisi tanır.

JPG

veya dosyayı buraya sürükleyip bırakın

JPEG görüntünüzü yükleyin

Hızlı dönüştürmeGüvenli işlemeKayıt gerektirmez

Fotoğraflardan Tek Bir TXT'ye

JPEG fotoğraflarını tek bir ZIP'e koyun. OCR onları dosya adı sırasıyla okur ve tanınan kelimeleri, her sayfa sınırında bir ayırıcıyla tek bir düz metin dosyasına ekler. Fotoğrafın görünüşüne dair her şey — ışık, kâğıt rengi, el yazısı — kaybolur; okunduğu sırayla yazıya dökülmüş kelimeler kalır.

Kamera fotoğraflarıyla dolu bir klasörü, elektronik tablo formülünden komut satırı aramasına kadar metin girdisi bekleyen her şey için kullanılabilir hale getiren işte bu düzleştirme adımıdır; bunların hiçbiri zaten JPEG okumayı bilmez. Sabit bir işaret satırı dosyayı fotoğraf başına bölümlere ayırır; altıncı sayfaya gitmek, paragrafları gözle saymak yerine bu işaretin altıncı geçişini aramak demektir ve bu yöntem elli sayfayı aşan fotoğraflı bir taramada bile işe yarar.

Çok Sayfalı Belge OCR

Çok sayfalı OCR araçlarımızla tüm belge setlerini işleyin. Sayfa görüntülerini sayfa sırasına göre adlandırıp tek bir ZIP'e koyun ve tek bir sonuç alın: aranabilir bir PDF, bir Word belgesi ya da tüm sayfaları içeren metin. Kitap, rapor, yazışma ve arşiv kayıtlarını dijitalleştirmek için idealdir.

Büyük belgeler için, toplu işleme sayfa sayfa dönüştürmeye kıyasla önemli zaman kazandırır. Araçlarımız sayfa sırasını korur, sayfalar arasındaki değişen görsel kaliteyi işler ve gözden geçirme ve kullanıma hazır birleştirilmiş çıktı üretir. Her sayfanın orijinal düzeni çıktıda korunur.

Bir Kamera Grubundan Doğruluk

Fotoğraf kalitesi, bu dönüştürmeyi OCR adımından daha fazla belirler: laminatlı bir sayfadan yansıyan parlama, titrek elle çekilmiş bir fotoğraf veya eşit olmayan ışık, kelimeleri düşürebilir veya karakterleri karıştırabilir ve biçimlendirilmiş bir belgenin aksine, tanımanın nerede yanlış gittiğini fark etmenize yardımcı olacak görsel bir düzen sonrasında kalmaz.

Gruba güvenmeden önce, ham metni bulanık veya kötü aydınlatıldığını hatırladığınız bir fotoğrafla karşılaştırarak gözden geçirin; düz metinde eksik bir kelime hızlı bir okumada kolayca gözden kaçar, çünkü o sayfada bir şeylerin yanlış gittiğini işaretleyen bozuk bir biçimlendirme yoktur. Görünür sütun çizgileri olan fotoğraflanmış bir fatura veya elektronik tablo bile .txt dosyasında tek bir kelime akışı olarak çıkar; değerler, OCR'nin fotoğrafı taradığı soldan sağa sırayla yerleştirilir, bu yüzden kağıtta kendi sütun başlığının altında duran bir toplam, sütunlar ortadan kalktığında ilgisiz bir kelimenin hemen yanına düşebilir.

Düz Metin Çıktısı İçin Çekim Yapmak

Tüm grup boyunca eşit ve yayılı aydınlatma, burada biçimlendirilmiş bir belge dönüştürmesine göre daha fazla önem taşır, çünkü sonradan kaba bir sayfayı maskeleyecek bir biçimlendirme geçişi yoktur; yazıya dökülen kelimeler çıktının tamamıdır, bu yüzden OCR'nin yanlış okuduğu her şey doğrudan son dosyada görünür. Dosya, bir script veya elektronik tablo içe aktarımı için aksanlı karakterleri ve çoğu sembolü doğru şekilde kapsayan UTF-8 kodlamasıyla ve Unix tarzı satır sonlarıyla kaydedilir; içe aktarılan metin hâlâ bozuk görünüyorsa, içe aktarma adımının farklı bir varsayılan kodlamaya dönmek yerine gerçekten UTF-8 okuduğunu kontrol edin.

Dosyaları ZIP'lemeden önce sayfa sırasına göre adlandırın (01, 02, 03…): sayfalar dosya adlarını izler ve sonradan yeniden sıralama adımı yoktur.