Pengenalan Karakter Optik
OCR (Pengenalan Karakter Optik) mengubah gambar teks menjadi teks aktual yang dapat diedit. Dokumen yang dipindai, foto halaman, dan PDF berbasis gambar menjadi dapat dicari dan diedit setelah pemrosesan OCR. Alat kami mengenali teks dalam berbagai bahasa, mempertahankan tata letak dokumen, dan menghasilkan format pilihan Anda: PDF yang dapat dicari yang terlihat identik dengan aslinya tetapi dengan teks yang dapat dipilih, atau dokumen Word yang dapat diedit untuk modifikasi konten penuh. Sempurna untuk mendigitalkan arsip kertas, mengekstrak data dari pindaian, atau membuat dokumen dapat diakses.
Cara Kerja Teknologi OCR
Pengenalan karakter optik menganalisis gambar untuk menemukan teks. Mesin menemukan area teks, baris, kata, dan karakter satu per satu, lalu mencocokkan setiap bentuk dengan pola yang dikenal untuk menentukan huruf, angka, atau simbolnya. Gambar dibaca apa adanya—tanpa pelurusan otomatis atau koreksi kontras—jadi pindaian yang lurus dan pencahayaannya merata memberi hasil terbaik.
OCR modern menggunakan model machine learning yang dilatih dengan jutaan contoh dokumen. Model ini mengenali karakter dalam berbagai font, ukuran, dan gaya dengan akurasi tinggi. Model ini bisa menangani teks yang rusak dari fotokopi, dokumen pudar, dan scan resolusi rendah yang akan menyulitkan sistem OCR lama.
Mengoptimalkan Kualitas Dokumen untuk OCR
Kualitas scan langsung memengaruhi akurasi OCR. Targetkan 300 DPI (dots per inch) atau lebih tinggi—ini memberikan detail yang cukup untuk pengenalan karakter yang andal. Bersihkan kaca scanner sebelum memindai untuk menghindari noda dan garis-garis. Letakkan dokumen dengan rata dan lurus untuk meminimalkan kemiringan yang bisa membingungkan deteksi baris teks.
Untuk dokumen yang difoto, pastikan pencahayaan merata tanpa bayangan di atas teks. Pegang kamera sejajar dengan permukaan dokumen untuk menghindari distorsi perspektif. Potong rapat ke tepi dokumen dan simpan dalam format PNG (lossless) daripada JPEG (yang menambahkan artefak kompresi di sekitar teks).
Memilih Antara PDF yang Bisa Dicari dan DOCX yang Bisa Diedit
Output PDF yang bisa dicari mempertahankan tampilan dokumen asli Anda persis sambil menambahkan lapisan teks tak terlihat. Ini memungkinkan Anda mencari dalam dokumen, memilih dan menyalin teks, tetapi tetap mempertahankan kesetiaan visual dari scan asli. Ideal untuk mengarsipkan dokumen historis, catatan legal, atau dokumen apa pun di mana keaslian visual penting.
Output DOCX membuat dokumen yang sepenuhnya bisa diedit di mana teks, format, dan tata letak bisa dimodifikasi. Mesin OCR berusaha merekonstruksi struktur paragraf, font, dan format dasar. Gunakan DOCX saat Anda perlu merevisi konten, mengekstrak bagian untuk digunakan kembali, atau mengintegrasikan teks hasil scan ke dokumen lain.
OCR Dokumen Multi-Halaman
Proses seluruh kumpulan dokumen dengan alat OCR multi-halaman kami. Masukkan gambar halaman ke satu ZIP, beri nama sesuai urutan halaman, dan dapatkan satu hasil gabungan—PDF yang bisa dicari, dokumen Word, atau teks dengan semua halaman. Ideal untuk mendigitalkan buku, laporan, korespondensi, dan arsip.
Untuk dokumen besar, pemrosesan batch menghemat waktu yang signifikan dibandingkan konversi halaman per halaman. Tools kami mempertahankan urutan halaman, menangani kualitas gambar yang bervariasi antar halaman, dan menghasilkan output gabungan yang siap ditinjau dan digunakan. Tata letak asli setiap halaman dipertahankan dalam output.
Dukungan Bahasa untuk OCR
Bahasa yang kamu pilih menentukan model pengenalan mana yang membaca berkas, dan setiap model hanya mengenal satu keluarga huruf. Halaman berbahasa Rusia yang dibaca sebagai bahasa Inggris kembali sebagai teks tanpa makna, jadi pilihan ini lebih berbobot daripada pengaturan apa pun di halaman ini. Mode Otomatis mengambil pilihan ini untukmu: ia mengenali aksara di setiap halaman (Latin, Sirilik, Yunani, Arab, Devanagari, Thai, Korea, Mandarin, atau Jepang) lalu memakai model yang sesuai; hanya Mandarin Tradisional yang sebaiknya dipilih manual.
Dokumen yang halamannya berbeda bahasa tidak perlu dipecah dalam mode Otomatis: setiap halaman dibaca dengan modelnya sendiri. Di dalam satu halaman, baris beralfabet lain dibaca dengan model halaman itu, jadi untuk halaman seperti ini pilih bahasa utamanya atau pindahkan bagian berbahasa lain ke halaman tersendiri. Untuk hasil terbaik dengan konten khusus (medis, legal, teknis), harapkan error sesekali dalam terminologi khusus domain.
Aplikasi OCR yang Umum
Pengguna bisnis mendigitalkan kontrak, faktur, kwitansi, dan korespondensi untuk arsip yang bisa dicari. Tim legal mengonversi berkas kasus dan dokumen discovery untuk pencarian teks lengkap. Organisasi kesehatan mendigitalkan rekam medis pasien dan formulir medis. Institusi pendidikan mengarsipkan dokumen historis, materi penelitian, dan publikasi langka.
Instansi pemerintah membuat catatan publik bisa dicari dan diakses. Peneliti mengekstrak teks dari koran, manuskrip, dan arsip cetak historis. Akuntan mendigitalkan catatan keuangan untuk analisis. Semua alur kerja yang melibatkan dokumen kertas mendapatkan manfaat dari digitalisasi OCR.
OCR vs Konversi PDF Langsung: Mana yang Anda Butuhkan?
Tidak semua konversi PDF to Word membutuhkan OCR. Jika PDF Anda dibuat secara digital—diekspor dari Word, dihasilkan oleh software, atau dibuat dari teks digital—PDF tersebut sudah berisi teks yang bisa diekstrak. Tools konversi langsung seperti konverter PDF to Word kami mengekstrak lapisan teks ini dengan cepat dan akurat. OCR tidak diperlukan untuk dokumen ini dan justru bisa menurunkan kualitas.
OCR menjadi penting saat PDF hanya berisi gambar: dokumen kertas hasil scan, halaman yang difoto, faks, atau PDF yang dibuat dari file gambar. Dokumen ini terlihat seperti teks secara visual tetapi tidak mengandung data teks sebenarnya—hanya gambar teks. Tools OCR kami menganalisis gambar ini, mengenali karakter, dan membuat teks nyata yang bisa diedit. Jika Anda tidak bisa memilih teks di PDF Anda, Anda membutuhkan OCR.
Untuk panduan lengkap tentang menangani dokumen hasil scan, baca panduan rinci kami tentang mengonversi PDF hasil scan menjadi dokumen Word yang bisa diedit dengan OCR. Panduan ini mencakup tips persiapan, optimasi kualitas, dan pemecahan masalah umum. Learn more about OCR for scanned PDFs
Tips untuk Hasil OCR Terbaik
Persiapan sangat memengaruhi akurasi OCR. Untuk pemindaian, gunakan resolusi minimal 300 DPI dengan teks hitam di atas latar putih. Bersihkan kaca scanner, luruskan halaman, dan hindari bayangan atau lipatan. Untuk foto, pastikan pencahayaan merata, pegang kamera sejajar dengan dokumen, dan gunakan pengaturan resolusi tertinggi.
Pilih bahasa dokumen yang tepat sebelum pemrosesan—ini mengaktifkan kamus khusus bahasa dan pola karakter. Setelah konversi, selalu periksa ulang hasilnya, terutama untuk angka, nama, dan istilah teknis. OCR bisa membingungkan karakter yang mirip seperti 0/O, 1/l/I, dan rn/m. Gunakan spell-check sebagai titik awal, tetapi verifikasi data penting secara manual.