Bir PDF'in Metnini Kopyalamak Üzere Çıkarma
Araç önce PDF'inizde mevcut bir metin katmanı olup olmadığını kontrol eder ve varsa bu metni doğrudan alır; bunun yerine taranmış görüntü olan sayfaları ise kelimeler sonuca eklenmeden önce OCR okur. Her iki durumda da size, indirip yeniden açmanız gereken bir dosya değil, seçip yapıştırmaya hazır metin döner.
Sayfalar aralarında bir işaretle orijinal sıralarında tutulur; böylece büyük, çok sayfalı bir PDF bile göz gezdirip gerçekten ihtiyaç duyduğunuz kısmı kopyalayabileceğiniz tek ve kesintisiz bir metin bloğu olarak döner. Sonucu nereye yapıştırdığınız da satır sonlarının nasıl görüneceğini değiştirir: düz metin alanı her orijinal satırı ayrı tutarken bazı zengin metin hedefleri kısa satırları tek bir paragrafta birleştirir; bu yüzden çok sütunlu bir sayfa yapıştırdıktan hemen sonra iç içe geçmiş görünürse hedefi bir kez kontrol edin.
Bu Araç Mümkün Olduğunda OCR'yi Neden Atlar
Bir kelime işlemciden oluşturulmuş ya da bir web sayfasından dışa aktarılmış PDF genellikle zaten doğru metin içerir; bunu yine de OCR'dan geçirmek işlem süresini uzatır ve hiç okunması gerekmeyen içeriğe hata katma riski yaratır. Bu yüzden bir metin katmanı olduğunda her zaman doğrudan çıkarım kullanılır.
Sözleşmeleri, makbuzları, tarihi belgeleri, kitap sayfalarını dijitalleştirmek için gereklidir. Ekran okuyucuların sesli okuma yapabilmesi için gerçek metne ihtiyacı vardır; OCR taranmış belgeleri erişilebilir hale getirir. Manuel yeniden yazmaya kıyasla saatler kazandırır.
Kaynak PDF'i Değerlendirme
Normal bir görüntüleyicide zaten metni vurgulayabildiğiniz bir PDF, neredeyse birebir aynı şekilde geri döner, çünkü bu, hiçbir tanıma tahmini içermeyen doğrudan bir çıkarmadır; buradaki kalite yalnızca orijinal dosyanın kodlamasının kalitesine bağlıdır ve bu genellikle çok iyidir.
Metni seçmenin yalnızca sayfanın etrafına bir kutu çizdiği, gerçekte hiçbir şeyin seçilemediği bir PDF, bir taramadır ve bu sayfalar için kopyalanan sonuç, OCR'nin bir görseli okumasına bağlıdır; bir satır tuhaf görünüyorsa, tamamen güvenmeden önce böyle bir sayfayı kaynak PDF ile karşılaştırın. Zaten metin depolayan bir PDF'den gelen bir tablonun sayıları, her karakterin konumu dosyanın kendisinde kayıtlı olduğu için kullanılabilir bir sırayla gelir, ancak taranmış bir sayfadan çekilen aynı tablo, OCR'nin sütun sınırlarını doğru değerlendirmesine dayanır ve yanlış değerlendirilen bir sınır, yanlış etiketin yanına oturan bir rakam olarak ortaya çıkar.
Sonucu Kopyalamadan Önce
PDF'iniz bir taramaysa, el yazısı değil basılı, soluk değil yüksek kontrastlı daha keskin bir orijinal, OCR'ye çalışabileceği daha fazla şey verir ve kopyaladığınız metinde daha az hata olarak kendini gösterir, çünkü burada kötü bir tanımayı yumuşatacak bir biçimlendirme yedeği yoktur.
Uzun bir PDF için, tüm bloğu baştan sona okumak yerine ihtiyacınız olan bölüme atlamak için dönen metindeki sayfa işaretleyicilerini kullanın; bu genellikle yalnızca bir sayfa önemliyken her sayfanın bir kopyasında gezinmekten daha hızlıdır.