PNGを1つのTXTに圧縮
ZIP内のPNGはファイル名の順に読み取られ、各画像で認識された文字が1つのUTF-8の.txtファイルに追加されます。画像の区切りには区切り線が入ります。書式、フォント、レイアウトは捨てられ、残るのは文字だけです。
これは意図的なトレードオフです。.txt ファイルには保持すべき書式がないため、Word 文書ではなくこちらを選ぶ意味があるのは、元の見た目を残した文書ではなく、スクリーンショットのバッチから生のテキストだけが本当に必要な場合に限られます。各区切りはページの間に同じ短い 1 行を繰り返すため、任意のエディタでファイルを開いてその行を検索すれば、バッチ全体を目でスクロールしなくても、目的の元画像の先頭にすぐ移動できます。
複数ページ文書のOCR
複数ページ対応のOCRツールで、文書一式をまとめて処理できます。ページ画像をページ順の名前で1つのZIPに入れれば、検索可能なPDF、Word文書、全ページのテキストのいずれかで1つの結果が得られます。書籍、報告書、書簡、保管記録のデジタル化に最適です。
大きな文書の場合、一括処理はページごとの変換に比べて大幅な時間の節約になります。本ツールはページの順序を保ち、ページごとに異なる画像品質にも対応し、確認してすぐに使えるまとまった出力を生成します。各ページの元のレイアウトは出力にも保持されます。
プレーンファイルで失われるもの
PNGは可逆圧縮であるため、OCRエンジンはクリーンな画像を読み取ることができ、単語レベルの精度は他のPNGベースのツールと同程度になる傾向があります。ここでの違いは完全に出力側にあり、見出しや表、段落内の改行は構造として保持されません。
元のPNGに表が含まれている場合、.txt出力ではセルが列としてそろった状態ではなく、読み取り順につながった状態になると想定してください。これは認識エラーではなく、プレーンテキスト書き出しとして想定される動作です。表の多いページは、ファイルを解析に使う前に手作業で確認すべき主な理由がここにあります。ページ番号や会社名など、すべての元PNGに繰り返し現れるヘッダーやフッターの行は、まとめて除去されることなく.txtファイルにページごとに1回ずつ現れます。そのため、40ページのバッチでは、同じ短い行がテキストの中に40回散らばって出てくることになります。
クリーンなテキスト出力を得るために
ZIPにまとめる前に、ファイル名をページ順(01、02、03…)にしておきましょう。ページはファイル名の順に並び、後から並べ替える手順はありません。 出力はUnix形式の改行で、最近のエディターやスクリプト言語ならそのまま読めます。CR/LFの組を前提とする古いWindowsツールでは、先に簡単な変換が必要になることがあります。
PNGにラテン文字以外の文字や記号が含まれる場合は、エンコーディングに注意してください。UTF-8であれば大半のケースをカバーできますが、後段のツールが別のエンコーディングに設定されていると、OCRが正しく認識した文字を誤って読み取ってしまうことがあります。