複数の写真を1つのTXTに集約
JPEG写真を1つのZIPに入れてください。OCRはファイル名の順に読み取り、認識した文字をページ区切り付きで1つのテキストファイルに追加します。照明、紙の色、筆跡といった写真の見た目はすべて消え、読み取った順の文字だけが残ります。
このフラット化の処理があるからこそ、カメラで撮った写真のフォルダを、表計算の数式からコマンドラインでの検索まで、テキスト入力を前提とするあらゆるツールで使えるようになります。これらはどれも、そもそも JPEG を読むことができません。固定の区切り行がファイルを写真ごとのセクションに分けるので、6 ページ目に移動するには段落を目で数えるのではなく、その区切りの 6 回目の出現を検索するだけです。この方法は、撮影ページが 50 枚を超えるバッチでも通用します。
複数ページ文書のOCR
複数ページ対応のOCRツールで、文書一式をまとめて処理できます。ページ画像をページ順の名前で1つのZIPに入れれば、検索可能なPDF、Word文書、全ページのテキストのいずれかで1つの結果が得られます。書籍、報告書、書簡、保管記録のデジタル化に最適です。
大きな文書の場合、一括処理はページごとの変換に比べて大幅な時間の節約になります。本ツールはページの順序を保ち、ページごとに異なる画像品質にも対応し、確認してすぐに使えるまとまった出力を生成します。各ページの元のレイアウトは出力にも保持されます。
カメラ撮影バッチの精度
この変換では、OCR処理そのものよりも写真の画質が結果を左右します。ラミネート加工されたページの反射、手ブレ、照明のムラは文字の欠落や文字化けを招きます。しかも整形された書類と違い、変換後には視覚的なレイアウトが残らないため、どこで認識が誤ったのかを見つける手がかりがありません。
バッチ結果を信頼する前に、ブレていた、または照明が悪かったと記憶している写真については、出力されたテキストを見比べてください。プレーンテキストでは単語が1つ欠けていても、レイアウトが崩れて警告してくれるわけではないため、ざっと読んだだけでは見落としがちです。罫線のはっきり見える請求書や表を撮影した場合でも、.txtファイルでは単語がひと続きの文字列になり、OCRが写真を読み取った左から右への順序でそのまま値が並びます。そのため、紙の上では自分の列見出しの下にあった合計値が、列という区切りが失われた結果、無関係な単語のすぐ隣に来てしまうことがあります。
プレーンテキスト出力のための撮影
書式付き文書への変換と比べ、ここではバッチ全体にわたる均一で柔らかい照明がより重要です。後から粗いページを補正する整形処理が入らないため、書き起こされた文字がそのまま最終出力になり、OCRが誤読した箇所はそのまま最終ファイルに現れます。ファイルはUTF-8、Unix形式の改行で保存されるため、アクセント付き文字やほとんどの記号はスクリプトやスプレッドシートへのインポートで正しく扱えます。インポート後のテキストが文字化けして見える場合は、インポート処理側がUTF-8として読み込んでいるか、別のデフォルトエンコーディングにフォールバックしていないかを確認してください。
ZIPにまとめる前に、ファイル名をページ順(01、02、03…)にしておきましょう。ページはファイル名の順に並び、後から並べ替える手順はありません。