PDF'den TXT'ye (OCR)

OCR kullanarak taranmış PDF belgelerinden düz TXT dosyalarına metin çıkarın. Görsel tabanlı PDF'lerdeki metni tanıyıp düzenlenebilir metin dosyası olarak indirin.

Doğru alfabenin tanınması için metnin dilini seçin. Otomatik mod her sayfadaki alfabeyi kendisi tanır.

PDF

veya dosyayı buraya sürükleyip bırakın

PDF dosyanızı yükleyin

Hızlı dönüştürmeGüvenli işlemeKayıt gerektirmez

Bir PDF'den Bir TXT Dosyasına

Taranmış bir PDF, fotoğraf veya görsel yükleyin. OCR, metni piksellerden okur ve düzenlenebilir karakterlere dönüştürür. Birden fazla dilde basılı metinle çalışır. Düşük kaliteli taramaları, eğri sayfaları, farklı yazı tiplerini işler.

Her iki durumda da sayfaların sırayla eklendiği ve her sayfa sonunun bir ayırıcıyla işaretlendiği tek bir .txt dosyası elde edersiniz; dosya kaydetmeye, aramaya veya bir betiğe aktarmaya hazırdır. Son dosyada çıkarılan metinle OCR ile tanınan metin arasındaki fark görünmez.

Önce Bir Metin Katmanı Olup Olmadığını Neden Kontrol Etmelisiniz

Taranmış belgeler yalnızca görsellerdir. Bunlarda arama yapamaz, metin kopyalayamaz veya düzenleyemezsiniz. OCR, görselleri gerçek metne dönüştürür. Eski kağıt arşivlerini aranabilir hale getirir. Taranmış formlardan veri çıkarmanızı sağlar. Basılı materyalleri düzenlenebilir dosyalara dönüştürür.

Sözleşmeleri, makbuzları, tarihi belgeleri, kitap sayfalarını dijitalleştirmek için gereklidir. Ekran okuyucuların sesli okuma yapabilmesi için gerçek metne ihtiyacı vardır; OCR taranmış belgeleri erişilebilir hale getirir. Manuel yeniden yazmaya kıyasla saatler kazandırır.

Elinizdekini Nasıl Anlarsınız

Normal bir okuyucuda PDF'den zaten metin seçip kopyalayabiliyorsanız, bir metin katmanı var demektir ve .txt çıktısı, hiçbir OCR tahmini söz konusu olmadığı için o gömülü metne yakından uyacaktır; bu durumda doğruluk yalnızca PDF'in nasıl oluşturulduğuna bağlıdır.

Metni seçmek için tıklamak yalnızca tüm sayfanın etrafında bir dikdörtgeni vurguluyorsa veya hiçbir şey olmuyorsa, o sayfa taranmış bir görseldir ve onun için .txt içeriği OCR kalitesine bağlıdır; taranmış bir sayfa beklenenden daha kötü okunuyorsa tarama çözünürlüğünü ve orijinal belgenin netliğini kontrol edin. Zaten bir metin katmanı taşıyan bir PDF içindeki bir tablo, genellikle hücre değerlerini mantıklı bir okuma sırasında tutar, çünkü her karakterin konumu doğrudan dosyada saklanır; oysa taranmış bir sayfadaki aynı tablo, OCR'nin sütunları doğru şekilde takip etmesine bağlıdır, bu yüzden taranmış bir fatura, doğrudan yerel bir PDF'den çekilen bir tabloya göre sonradan elle yeniden hizalanmaya ihtiyaç duyma olasılığı daha yüksektir.

Güvenilir TXT Çıktısı Elde Etme

Taranmış bir PDF için, girdi olarak daha yüksek çözünürlüklü bir tarama, çıktıda daha temiz bir metin üretir; taramayı siz yapıyorsanız 300 DPI veya üzeri makul bir hedeftir, çünkü daha düşük herhangi bir değer küçük yazılarda OCR doğruluğundan kaybettirmeye başlar.

Yerel ve taranmış sayfaları karıştıran bir PDF için, .txt çıktısını ikisi arasındaki sınırın etrafında kontrol edin, çünkü sayfa düzeyindeki işlemenin değiştiği ve alışılmadık bir başlık veya alt bilginin bazen ayırıcı işaretlerdeki sayfa sırasını karıştırdığı tek nokta burasıdır. Dosya, bir sayfa doğrudan çıkarmadan mı yoksa OCR'den mi geldiğine bakılmaksızın, baştan sona UTF-8 olarak ve Unix tarzı satır sonlarıyla yazılır; bu yüzden sonucu okuyan bir script, metin yazıldıktan sonra iki tür kaynak sayfa için ayrı bir işleme ihtiyaç duymaz.