Çoklu PNG'den TXT'ye (OCR)

OCR kullanarak birden fazla PNG görselinden toplu metin çıkarın. Birkaç görseldeki metni tek bir TXT dosyasında birleştirin. Belge taramalarını verimli şekilde işleyin.

Doğru alfabenin tanınması için metnin dilini seçin. Otomatik mod her sayfadaki alfabeyi kendisi tanır.

PNG

veya dosyayı buraya sürükleyip bırakın

PNG görüntünüzü yükleyin

Hızlı dönüştürmeGüvenli işlemeKayıt gerektirmez

PNG'lerden Tek Bir TXT'ye

ZIP'inizdeki PNG'ler dosya adı sırasıyla okunur ve her görüntüden tanınan kelimeler, bir görüntünün bitip sonrakinin başladığı yerde ayırıcı bir satırla tek bir UTF-8 .txt dosyasına eklenir. Biçimlendirme, yazı tipleri ve düzen atılır; geriye yalnızca kelimeler kalır.

Bu bilinçli bir tercihtir: bir .txt dosyasında korunacak biçimlendirme yoktur; bu yüzden onu Word belgesi yerine seçmek, yalnızca orijinallere benzeyen bir belge değil de bir grup ekran görüntüsündeki ham metin gerçekten gerektiğinde mantıklıdır. Her ayırıcı sayfalar arasında aynı kısa metin satırını tekrarlar; dosyayı herhangi bir düzenleyicide açıp tam olarak bu satırı aradığınızda, tüm grubu gözle kaydırmak yerine seçtiğiniz kaynak görüntünün başına doğrudan atlarsınız.

Çok Sayfalı Belge OCR

Çok sayfalı OCR araçlarımızla tüm belge setlerini işleyin. Sayfa görüntülerini sayfa sırasına göre adlandırıp tek bir ZIP'e koyun ve tek bir sonuç alın: aranabilir bir PDF, bir Word belgesi ya da tüm sayfaları içeren metin. Kitap, rapor, yazışma ve arşiv kayıtlarını dijitalleştirmek için idealdir.

Büyük belgeler için, toplu işleme sayfa sayfa dönüştürmeye kıyasla önemli zaman kazandırır. Araçlarımız sayfa sırasını korur, sayfalar arasındaki değişen görsel kaliteyi işler ve gözden geçirme ve kullanıma hazır birleştirilmiş çıktı üretir. Her sayfanın orijinal düzeni çıktıda korunur.

Düz Bir Dosyanın Kaybettiği

PNG kayıpsız olduğu için, OCR motoru okumak üzere temiz bir görsel alır; bu yüzden bu girdide kelime düzeyindeki doğruluk, herhangi bir başka PNG tabanlı araçtaki kadar iyi olma eğilimindedir; buradaki fark tamamen çıktı tarafındadır, burada başlıklar, tablolar ve bir paragraf içindeki satır sonları yapı olarak korunmaz.

Kaynak PNG'leriniz bir tablo içeriyorsa, .txt çıktısının hücreleri sütunlarda hizalı tutmak yerine okuma sırasına göre birleştirmesini bekleyin; bu, bir tanıma hatası değil, düz metin dışa aktarımı için beklenen bir davranıştır ve dosyaya ayrıştırma için güvenmeden önce tablo ağırlıklı bir sayfayı elle kontrol etmenin ana nedenidir. Her kaynak PNG'de tekrarlanan bir başlık veya alt bilgi satırı — bir sayfa numarası veya bir şirket adı gibi — birleştirilip kaldırılmak yerine .txt dosyasında sayfa başına bir kez geçer; bu yüzden kırk sayfalık bir grup, metninizin ortasına kırk kez saçılmış aynı kısa satırla sonuçlanabilir.

Temiz Metin Çıktısı Elde Etme

Dosyaları ZIP'lemeden önce sayfa sırasına göre adlandırın (01, 02, 03…): sayfalar dosya adlarını izler ve sonradan yeniden sıralama adımı yoktur. Çıktı, modern düzenleyicilerin ve betik dillerinin doğrudan okuduğu Unix tarzı satır sonları kullanır; CR/LF çiftleri bekleyen eski bir Windows aracı önce hızlı bir dönüştürme gerektirebilir.

PNG'leriniz Latin olmayan karakterler veya semboller içeriyorsa kodlamaya dikkat edin; UTF-8 çoğu durumu kapsar, ancak farklı bir kodlamaya ayarlanmış sonraki bir araç, OCR'nin doğru tanıdığı karakterleri yine de yanlış okuyabilir.