複数JPEGからテキスト抽出(OCR)

複数のJPEG写真からテキストを抽出し、結合した結果を確認。OCRテキストをクリップボードにコピーまたはダウンロード。文書撮影の連続処理に対応。

正しい文字体系で認識されるように、テキストの言語を選んでください。自動を選ぶと、ページごとの文字体系が自動で判別されます。

JPG

またはファイルをここにドラッグ&ドロップ

JPEG画像をアップロード

高速変換安全な処理登録不要

貼り付け用テキストに変換する写真

JPEG写真を読む順の名前(01.jpg、02.jpg…)で1つのZIPに入れてください。OCRはファイル名の順に各写真の文字を抽出し、まとめた結果をすぐ選択・貼り付けできるテキストで返します。ファイルをダウンロードする必要はありません。

写真はまとめて処理されるため、貼り付けたテキストでもページは撮影した順に並び、各ページの間には区切りが入ります。そのため、どこで 1 枚の撮影ページが終わり、次が始まるのかがわかります。区切りは「--- Page Break ---」という 1 行なので、検索で見つけることも、一度の検索と置換ですべて削除することもできます。

複数ページ文書のOCR

複数ページ対応のOCRツールで、文書一式をまとめて処理できます。ページ画像をページ順の名前で1つのZIPに入れれば、検索可能なPDF、Word文書、全ページのテキストのいずれかで1つの結果が得られます。書籍、報告書、書簡、保管記録のデジタル化に最適です。

大きな文書の場合、一括処理はページごとの変換に比べて大幅な時間の節約になります。本ツールはページの順序を保ち、ページごとに異なる画像品質にも対応し、確認してすぐに使えるまとまった出力を生成します。各ページの元のレイアウトは出力にも保持されます。

カメラ撮影が精度に与える影響

ここでは、PNGの一括処理の場合よりも撮影条件が精度に大きく影響します。反射、ぼやけ、不均一な照明はいずれも認識精度を下げる要因となり、出力がレイアウトの残らないプレーンテキストであるため、誤読された単語は書式のある文書内のように目立つことなく、周囲の文にそのまま溶け込んでしまいます。

貼り付けたテキストを重要な用途で使う前に、きれいに撮影するのが最も難しかった写真、たいていは斜めから撮影されたものや照明が不均一なもの、と照らし合わせて確認してください。そのページは単語が欠落している可能性が最も高いためです。列がはっきり分かれたレシートや表を撮影した場合でも、貼り付けた時点では1つの語の連なりとして返ってきます。値は元の列の位置ではなく、OCRが読み取った順番のまま並ぶため、紙の上では見出しの下にあった数値が、プレーンテキストでは無関係な単語の隣に来てしまうこともあります。

コピー&ペースト用の写真の撮り方

スマートフォンはページと平行に持ち、一式全体を通して照明を均一に保ってください。この後に歪んだ行を補正する書式処理の工程がないため、傾いた写真や影のある写真からOCRが読み取った内容は、そのまま貼り付けたテキストになります。撮影時に手をしっかり安定させることが、このツールのどんな設定よりも、後の修正の手間を減らしてくれます。

ZIPにまとめる前に、ファイル名をページ順(01、02、03…)にしておきましょう。ページはファイル名の順に並び、後から並べ替える手順はありません。