Satu PDF Menjadi File TXT
Unggah PDF hasil pindai, foto, atau gambar. OCR membaca teks dari piksel dan mengubahnya menjadi karakter yang bisa disunting. Bekerja dengan teks cetak dalam berbagai bahasa. Menangani hasil pindai berkualitas rendah, halaman miring, dan font yang beragam.
Bagaimanapun caranya, Anda mendapatkan satu file .txt dengan halaman-halaman disusun berurutan dan pemisah yang menandai setiap pergantian halaman, siap disimpan, dicari, atau diteruskan ke skrip; di file akhir, teks hasil ekstraksi dan teks hasil OCR tidak bisa dibedakan.
Mengapa Periksa Lapisan Teks Terlebih Dahulu
Dokumen hasil pindai hanyalah gambar. Anda tidak bisa mencarinya, menyalin teks darinya, atau menyuntingnya. OCR mengubah gambar menjadi teks sungguhan. Membuat arsip kertas lama bisa dicari. Memungkinkan Anda mengekstrak data dari formulir hasil pindai. Mengonversi materi cetak menjadi file yang bisa disunting.
Penting untuk mendigitalkan kontrak, kwitansi, dokumen historis, halaman buku. Pembaca layar membutuhkan teks sungguhan untuk dibacakan—OCR membuat dokumen hasil pindai bisa diakses. Menghemat waktu berjam-jam dibanding mengetik ulang secara manual.
Cara Mengetahui Jenis PDF Anda
Jika Anda sudah bisa menyeleksi dan menyalin teks dari PDF di penampil biasa, berarti PDF tersebut memiliki lapisan teks dan hasil .txt-nya akan sangat mendekati teks yang tertanam tersebut, karena sama sekali tidak ada tebakan OCR yang terlibat; akurasinya dalam kasus ini hanya bergantung pada bagaimana PDF tersebut awalnya dibuat.
Jika mengeklik untuk menyeleksi teks hanya menyorot sebuah persegi panjang di seluruh halaman, atau tidak terjadi apa-apa, halaman tersebut adalah gambar hasil pindaian dan isi .txt untuknya bergantung pada kualitas OCR; periksa resolusi pindaian dan ketajaman dokumen aslinya jika sebuah halaman hasil pindaian terbaca lebih buruk dari yang diharapkan. Sebuah tabel di dalam PDF yang sudah memiliki lapisan teks biasanya mempertahankan nilai selnya dalam urutan baca yang masuk akal, karena posisi setiap karakter tersimpan langsung dalam file, sementara tabel yang sama pada halaman hasil pindaian bergantung pada OCR yang membaca kolom dengan benar, sehingga faktur hasil pindaian lebih mungkin membutuhkan penyusunan ulang manual setelahnya dibandingkan yang diambil langsung dari PDF asli.
Mendapatkan Hasil TXT Yang Andal
Untuk PDF hasil pindaian, pindaian dengan resolusi lebih tinggi menghasilkan teks yang lebih bersih, dengan 300 DPI atau lebih menjadi target yang wajar jika Anda sendiri yang melakukan pemindaian, karena resolusi di bawah itu mulai mengurangi akurasi OCR pada cetakan yang lebih kecil.
Untuk PDF yang mencampur halaman asli dan hasil pindaian, periksa hasil .txt di sekitar batas antara keduanya, karena di situlah satu-satunya tempat penanganan tingkat halaman berubah dan di mana header atau footer yang tidak biasa terkadang membingungkan urutan halaman pada penanda pemisah. File ditulis sebagai UTF-8 dengan jeda baris gaya Unix secara menyeluruh, baik halaman tersebut berasal dari ekstraksi langsung maupun dari OCR, sehingga sebuah skrip yang membaca hasilnya tidak perlu penanganan terpisah untuk kedua jenis halaman sumber setelah teksnya ditulis.