Beberapa JPEG ke TXT (OCR)

Ekstrak teks dari beberapa gambar JPEG sekaligus menggunakan OCR. Gabungkan teks dari rangkaian foto menjadi satu file TXT yang bisa diunduh.

Pilih bahasa teks agar alfabet yang tepat dikenali. Mode otomatis mengenali sendiri alfabet di setiap halaman.

JPG

atau seret dan lepas file di sini

Unggah gambar JPEG Anda

Konversi cepatPemrosesan amanTanpa pendaftaran

Foto Dipadatkan Menjadi Satu TXT

Masukkan foto JPEG ke satu ZIP. OCR membacanya sesuai urutan nama file dan menambahkan kata yang dikenali ke satu file teks biasa, dengan pemisah di setiap batas halaman. Semua tentang tampilan foto—pencahayaan, warna kertas, gaya tulisan—hilang; yang tersisa adalah kata-kata dalam urutan dibaca.

Langkah perataan inilah yang membuat satu folder foto kamera bisa dipakai oleh apa pun yang membutuhkan masukan teks, mulai dari rumus spreadsheet hingga pencarian di baris perintah—yang tak satu pun bisa membaca JPEG. Satu baris penanda tetap membagi file menjadi bagian per foto, dan untuk melompat ke halaman enam cukup cari kemunculan keenam penanda itu alih-alih menghitung paragraf dengan mata, cara yang tetap andal pada kumpulan pindaian lebih dari lima puluh halaman foto.

OCR Dokumen Multi-Halaman

Proses seluruh kumpulan dokumen dengan alat OCR multi-halaman kami. Masukkan gambar halaman ke satu ZIP, beri nama sesuai urutan halaman, dan dapatkan satu hasil gabungan—PDF yang bisa dicari, dokumen Word, atau teks dengan semua halaman. Ideal untuk mendigitalkan buku, laporan, korespondensi, dan arsip.

Untuk dokumen besar, pemrosesan batch menghemat waktu yang signifikan dibandingkan konversi halaman per halaman. Tools kami mempertahankan urutan halaman, menangani kualitas gambar yang bervariasi antar halaman, dan menghasilkan output gabungan yang siap ditinjau dan digunakan. Tata letak asli setiap halaman dipertahankan dalam output.

Akurasi Dari Batch Foto Kamera

Kualitas foto lebih menentukan konversi ini dibandingkan langkah OCR itu sendiri: silau dari halaman yang dilaminasi, foto genggam yang goyang, atau cahaya yang tidak merata akan menghilangkan kata atau mengacaukan karakter, dan tidak seperti dokumen yang diformat, tidak ada tata letak visual yang tersisa untuk membantu Anda melihat di mana pengenalan teksnya salah.

Baca sekilas teks mentahnya dibandingkan dengan foto yang Anda ingat buram atau kurang tersinari sebelum mempercayai hasil batch; kata yang hilang dalam teks polos mudah terlewat pada pembacaan cepat, karena tidak ada format yang rusak yang menandai adanya kesalahan pada halaman tersebut. Faktur atau spreadsheet yang difoto dengan garis kolom yang terlihat tetap akan keluar sebagai satu rangkaian kata dalam file .txt, dengan nilai-nilai ditempatkan sesuai urutan kiri-ke-kanan saat OCR membaca foto tersebut, sehingga sebuah total yang berada di bawah judul kolomnya sendiri di kertas bisa berakhir tepat di sebelah kata yang tidak terkait begitu kolomnya hilang.

Memotret Untuk Hasil Teks Polos

Pencahayaan yang merata dan menyebar di seluruh batch lebih penting di sini dibandingkan konversi dokumen yang diformat, karena tidak ada proses format selanjutnya yang bisa menutupi halaman yang kurang rapi; kata-kata hasil transkripsi adalah keseluruhan output-nya, jadi apa pun yang salah dibaca OCR akan langsung muncul di file akhir. File disimpan sebagai UTF-8 dengan jeda baris gaya Unix, yang mencakup karakter beraksen dan sebagian besar simbol dengan benar untuk skrip atau impor spreadsheet; jika teks yang diimpor masih terlihat berantakan, periksa apakah langkah impornya sendiri membaca UTF-8, bukan kembali ke encoding default yang berbeda.

Beri nama file sesuai urutan halaman (01, 02, 03…) sebelum dimasukkan ke ZIP: halaman mengikuti nama file, dan tidak ada langkah pengurutan ulang setelahnya.