Ekstrak Teks dari PDF (OCR)

Ekstrak dan langsung lihat teks dari dokumen PDF hasil pindai menggunakan OCR. Salin teks ke clipboard atau unduh sebagai file TXT. Tidak perlu instalasi software.

Pilih bahasa teks agar alfabet yang tepat dikenali. Mode otomatis mengenali sendiri alfabet di setiap halaman.

PDF

atau seret dan lepas file di sini

Unggah file PDF Anda

Konversi cepatPemrosesan amanTanpa pendaftaran

Mengekstrak Teks PDF Untuk Disalin

Unggah PDF hasil pindai, foto, atau gambar. OCR membaca teks dari piksel dan mengubahnya menjadi karakter yang bisa disunting. Bekerja dengan teks cetak dalam berbagai bahasa. Menangani hasil pindai berkualitas rendah, halaman miring, dan font yang beragam.

Halaman tetap dalam urutan aslinya dengan penanda di antaranya, sehingga PDF multi-halaman yang besar pun kembali sebagai satu blok teks yang utuh untuk Anda telusuri dan salin bagian yang benar-benar dibutuhkan. Tempat Anda menempelkan hasil juga memengaruhi jeda baris: kolom teks biasa mempertahankan setiap baris asli secara terpisah, sedangkan beberapa tujuan rich text menggabungkan baris-baris pendek menjadi satu paragraf, jadi periksa tujuannya sekali jika halaman berkolom tampak menyatu tepat setelah ditempel.

Mengapa Ini Melewati OCR Jika Memungkinkan

Dokumen hasil pindai hanyalah gambar. Anda tidak bisa mencarinya, menyalin teks darinya, atau menyuntingnya. OCR mengubah gambar menjadi teks sungguhan. Membuat arsip kertas lama bisa dicari. Memungkinkan Anda mengekstrak data dari formulir hasil pindai. Mengonversi materi cetak menjadi file yang bisa disunting.

Penting untuk mendigitalkan kontrak, kwitansi, dokumen historis, halaman buku. Pembaca layar membutuhkan teks sungguhan untuk dibacakan—OCR membuat dokumen hasil pindai bisa diakses. Menghemat waktu berjam-jam dibanding mengetik ulang secara manual.

Menilai PDF Sumber

PDF yang teksnya sudah bisa disorot di penampil biasa akan kembali hampir sama persis, karena itu adalah ekstraksi langsung tanpa tebakan pengenalan sama sekali; kualitasnya hanya sebaik encoding file aslinya, yang biasanya sudah sangat baik.

PDF yang saat teksnya diseleksi hanya menggambar kotak di sekitar halaman, tanpa ada yang benar-benar bisa diseleksi, berarti itu adalah hasil pindaian, dan hasil salinan untuk halaman tersebut bergantung pada OCR yang membaca sebuah gambar; periksa halaman semacam itu terhadap PDF sumbernya jika sebuah baris terlihat aneh sebelum sepenuhnya mempercayainya. Angka-angka pada sebuah tabel akan tersusun dalam urutan yang masuk akal jika berasal dari PDF yang sudah menyimpan teks, karena posisi setiap karakter tercatat langsung dalam file itu sendiri, tetapi tabel yang sama yang diambil dari halaman hasil pindaian bergantung pada OCR yang menilai batas kolom dengan benar, dan batas yang salah dinilai akan muncul sebagai sebuah angka yang berada di sebelah label yang salah.

Sebelum Anda Menyalin Hasilnya

Jika PDF Anda adalah hasil pindaian, dokumen asli yang lebih tajam, tercetak alih-alih tulisan tangan, berkontras tinggi alih-alih pudar, memberi OCR lebih banyak yang bisa dikerjakan dan menghasilkan lebih sedikit kesalahan pada teks yang Anda salin, karena tidak ada fallback format di sini yang bisa menyamarkan hasil pengenalan yang buruk.

Untuk PDF yang panjang, gunakan penanda halaman pada teks hasilnya untuk langsung menuju bagian yang Anda butuhkan, alih-alih membaca seluruh blok dari atas ke bawah; ini biasanya lebih cepat daripada menggulir salinan setiap halaman padahal hanya satu yang Anda perlukan.