Çevrimiçi OCR - Görüntüden Metne

OCR teknolojisi kullanarak görsellerden ve taranmış belgelerden metin çıkarın. JPG, PNG ve PDF'i doğru metin tanımayla aranabilir, düzenlenebilir formatlara dönüştürün.

Optik Karakter Tanıma

OCR (Optik Karakter Tanıma), metin görüntülerini gerçek, düzenlenebilir metne dönüştürür. Taranan belgeler, sayfa fotoğrafları ve görüntü tabanlı PDF'ler OCR işleminden sonra aranabilir ve düzenlenebilir hale gelir. Araçlarımız birden fazla dilde metin tanır, belge düzenini korur ve tercih ettiğiniz formata çıktı verir: orijinaline benzer görünen ancak seçilebilir metinli aranabilir PDF veya tam içerik değişikliği için düzenlenebilir Word belgeleri. Kağıt arşivleri dijitalleştirmek, taramalardan veri çıkarmak veya belgeleri erişilebilir kılmak için mükemmel.

OCR Teknolojisi Nasıl Çalışır

Optik karakter tanıma, metni bulmak için görüntüleri analiz eder. Motor metin bölgelerini, satırları, kelimeleri ve tek tek karakterleri bulur; her şekli bilinen desenlerle karşılaştırarak hangi harf, rakam ya da sembol olduğuna karar verir. Görüntüyü yüklediğiniz hâliyle okur, otomatik düzeltme veya kontrast ayarı yapmaz; bu yüzden düz ve eşit aydınlatılmış bir tarama en iyi sonucu verir.

Modern OCR, milyonlarca belge örneğiyle eğitilmiş makine öğrenimi modelleri kullanır. Bu modeller, çeşitli yazı tiplerinde, boyutlarında ve stillerinde karakterleri yüksek doğrulukla tanır. Fotokopilerden, solmuş belgelerden ve daha eski OCR sistemlerinin okumakta zorlanacağı düşük çözünürlüklü taramalardan bozulmuş metni işleyebilirler.

OCR İçin Belge Kalitesini Optimize Etme

Tarama kalitesi doğrudan OCR doğruluğunu etkiler. 300 DPI (inç başına nokta) veya üzerini hedefleyin — bu, güvenilir karakter tanıma için yeterli detay sağlar. Leke ve çizikleri önlemek için taramadan önce tarayıcı camını temizleyin. Metin satırı tespitini şaşırtabilecek eğikliği en aza indirmek için belgeleri düz ve düzgün yerleştirin.

Fotoğraflanan belgeler için, metin genelinde gölge olmadan eşit aydınlatma sağlayın. Perspektif bozulmasını önlemek için kamerayı belge yüzeyine paralel tutun. Belge kenarlarına sıkıca kırpın ve JPEG (metin etrafında sıkıştırma bozulması ekler) yerine PNG (kayıpsız) formatında kaydedin.

Aranabilir PDF ile Düzenlenebilir DOCX Arasında Seçim Yapma

Aranabilir PDF çıktısı, görünmez bir metin katmanı eklerken orijinal belge görünümünüzü tam olarak korur. Bu, belge içinde arama yapmanızı, metni seçip kopyalamanızı sağlarken orijinal taramanın görsel sadakatini korur. Tarihsel belgeleri, hukuki kayıtları veya görsel özgünlüğün önemli olduğu herhangi bir belgeyi arşivlemek için idealdir.

DOCX çıktısı, metnin, biçimlendirmenin ve düzenin değiştirilebileceği tamamen düzenlenebilir bir belge oluşturur. OCR motoru, paragraf yapısını, yazı tiplerini ve temel biçimlendirmeyi yeniden oluşturmaya çalışır. İçeriği revize etmeniz, yeniden kullanım için bölümleri çıkarmanız veya taranmış metni başka belgelere entegre etmeniz gerektiğinde DOCX kullanın.

Çok Sayfalı Belge OCR

Çok sayfalı OCR araçlarımızla tüm belge setlerini işleyin. Sayfa görüntülerini sayfa sırasına göre adlandırıp tek bir ZIP'e koyun ve tek bir sonuç alın: aranabilir bir PDF, bir Word belgesi ya da tüm sayfaları içeren metin. Kitap, rapor, yazışma ve arşiv kayıtlarını dijitalleştirmek için idealdir.

Büyük belgeler için, toplu işleme sayfa sayfa dönüştürmeye kıyasla önemli zaman kazandırır. Araçlarımız sayfa sırasını korur, sayfalar arasındaki değişen görsel kaliteyi işler ve gözden geçirme ve kullanıma hazır birleştirilmiş çıktı üretir. Her sayfanın orijinal düzeni çıktıda korunur.

OCR İçin Dil Desteği

Seçtiğin dil, dosyayı hangi tanıma modelinin okuyacağını belirler ve her model tek bir harf ailesini bilir. İngilizce olarak okunan bir Rusça sayfa anlamsız bir metin olarak geri döner; bu yüzden bu seçim, sayfadaki her ayardan daha çok ağırlık taşır. Otomatik mod bu seçimi senin yerine yapar: her sayfadaki yazıyı (Latin, Kiril, Yunan, Arap, Devanagari, Tay, Kore, Çin veya Japon yazısı) tanır ve uygun modeli kullanır; yalnızca Geleneksel Çince'yi elle seçmek daha iyi olur.

Sayfaları farklı dillerde olan bir belgeyi Otomatik modda bölmeniz gerekmez: her sayfa kendi modeliyle okunur. Tek bir sayfanın içinde ise başka bir alfabedeki satır o sayfanın modeliyle okunur; böyle bir sayfada sayfanın ana dilini seçin ya da diğer dildeki kısmı ayrı bir sayfaya taşıyın. Özel içerikle (tıbbi, hukuki, teknik) en iyi sonuçlar için, alana özgü terminolojide zaman zaman hatalar bekleyin.

Yaygın OCR Uygulamaları

İşletme kullanıcıları, aranabilir arşivler için sözleşmeleri, faturaları, makbuzları ve yazışmaları dijitalleştirir. Hukuk ekipleri, tam metin arama için dava dosyalarını ve keşif belgelerini dönüştürür. Sağlık kuruluşları hasta kayıtlarını ve tıbbi formları dijitalleştirir. Eğitim kurumları, tarihsel belgeleri, araştırma materyallerini ve nadir yayınları arşivler.

Devlet kurumları kamu kayıtlarını aranabilir ve erişilebilir hale getirir. Araştırmacılar tarihsel gazetelerden, el yazmalarından ve basılı arşivlerden metin çıkarır. Muhasebeciler analiz için finansal kayıtları dijitalleştirir. Kağıt belgeler içeren her iş akışı OCR dijitalleştirmesinden fayda sağlar.

OCR mi, Doğrudan PDF Dönüştürme mi: Hangisine İhtiyacınız Var?

Tüm PDF'den Word'e dönüştürmeler OCR gerektirmez. PDF'iniz dijital olarak oluşturulduysa — Word'den dışa aktarıldıysa, yazılım tarafından üretildiyse veya dijital metinden oluşturulduysa — zaten çıkarılabilir metin içerir. PDF'den Word'e dönüştürücümüz gibi doğrudan dönüştürme araçları bu metin katmanını hızlı ve doğru şekilde çıkarır. Bu belgeler için OCR gereksizdir ve aslında kaliteyi düşürür.

PDF'ler yalnızca görsel içerdiğinde OCR gerekli hale gelir: taranmış kağıt belgeler, fotoğraflanmış sayfalar, fakslar veya görsel dosyalarından oluşturulan PDF'ler. Bunlar görsel olarak metin gibi görünür ama gerçek metin verisi içermez — yalnızca metin resimleri. OCR araçlarımız bu görselleri analiz eder, karakterleri tanır ve gerçek, düzenlenebilir metin oluşturur. PDF'inizde metin seçemiyorsanız, OCR'a ihtiyacınız var.

Taranmış belgeleri işleme hakkında kapsamlı rehber için, taranmış PDF'leri OCR ile düzenlenebilir Word belgelerine dönüştürme konusundaki ayrıntılı kılavuzumuzu okuyun. Kılavuz, hazırlık ipuçlarını, kalite optimizasyonunu ve sık karşılaşılan sorunların çözümünü kapsar. Learn more about OCR for scanned PDFs

En İyi OCR Sonuçları İçin İpuçları

Hazırlık, OCR doğruluğunu önemli ölçüde etkiler. Tarama için, beyaz arka plan üzerine siyah metinle minimum 300 DPI çözünürlük kullanın. Tarayıcı camını temizleyin, sayfaları düz hizalayın ve gölge veya kırışıklıklardan kaçının. Fotoğraflar için, eşit aydınlatma sağlayın, kamerayı belgeye paralel tutun ve en yüksek çözünürlük ayarını kullanın.

İşlemeden önce doğru belge dilini seçin — bu, dile özgü sözlükleri ve karakter desenlerini etkinleştirir. Dönüştürmeden sonra, özellikle sayılar, özel isimler ve teknik terimler için her zaman çıktıyı kontrol edin. OCR, 0/O, 1/l/I ve rn/m gibi benzer karakterleri karıştırabilir. Yazım denetimini başlangıç noktası olarak kullanın, ama kritik verileri manuel olarak doğrulayın.

Sıkça Sorulan Sorular

OCR nedir ve nasıl çalışır?

OCR (Optik Karakter Tanıma), metin görsellerini makine tarafından okunabilir metne dönüştüren bir teknolojidir. Taranmış belgelerdeki veya fotoğraflardaki şekilleri ve desenleri analiz eder, karakterleri tanır ve arayabileceğiniz, kopyalayabileceğiniz ve düzenleyebileceğiniz düzenlenebilir metin çıktısı verir.

OCR kullanarak hangi dosya formatlarını dönüştürebilirim?

OCR araçlarımız JPG, PNG ve PDF dosyalarını destekler. Bunları aranabilir PDF'e (orijinal görünümü korurken metni seçilebilir hale getirerek) veya kelime işlemcilerde daha fazla düzenleme için düzenlenebilir DOCX formatına dönüştürebilirsiniz.

OCR metin tanıma ne kadar doğru?

OCR doğruluğu görüntü kalitesine ve metnin netliğine bağlıdır. Gerçek taranmış Rusça belgelerden oluşan 10 sayfalık testimizde karakter hata oranı bir sözleşmede %5,6, tablolar içeren bir banka hesap özetinde %7,6 oldu; yani her 100 karakterden yaklaşık 92–94'ü doğruydu. Doğruluğu artıran etkenler: düz metin yönü, yüksek kontrast, net yazı tipleri ve doğru dilin seçilmesi.

Belgeleri birden fazla dilde OCR ile işleyebilir miyim?

Evet. Seçebileceğin 29 belge dili var: Latin yazısı, Kiril, Yunanca, Arapça, Farsça, Devanagari, Çince, Japonca, Korece ve Tayca. Belgenin yazıldığı dili seç ya da Otomatik modda bırak: model sayfa sayfa seçilir, bu yüzden sayfaları farklı dillerde olan bir dosya bölünmeden okunur. Tek bir sayfa iki alfabeyi karıştırıyorsa, o sayfada hangi dil baskınsa onu seç.

Aranabilir PDF ile DOCX çıktısı arasındaki fark nedir?

Aranabilir PDF, arama ve kopyalama için görünmez bir metin katmanı eklerken orijinal belge görünümünüzü korur. DOCX, metni, biçimlendirmeyi ve düzeni değiştirebileceğiniz tamamen düzenlenebilir bir belge oluşturur. Arşivleme için aranabilir PDF'i, düzenleme için DOCX'i seçin.

OCR, el yazısı notlardan metin çıkarabilir mi?

OCR en iyi basılı veya bilgisayarda yazılmış metinle çalışır. El yazısı tanıma (ICR) çok daha zordur ve OCR motorumuz bunun için tasarlanmamıştır; düzgün el yazısında bile çok sayıda hata, bitişik yazıda veya dağınık notlarda ise çok daha fazlasını bekleyin. El yazısı belgelerde sonuçlar okunaklılığa, tutarlılığa ve yazı stiline göre büyük ölçüde değişir. Basılı metin çok daha iyi sonuç verir.