PDFを1つのTXTファイルに
スキャンされたPDF、写真、画像をアップロードしてください。OCRはピクセルからテキストを読み取り、編集可能な文字に変換します。複数言語の印刷テキストに対応しています。低画質のスキャン、傾いたページ、さまざまなフォントにも対応します。
いずれの場合も、ページが順番に連結され、各改ページが区切りで示された 1 つの .txt ファイルが得られ、そのまま保存、検索、スクリプトへの受け渡しに使えます。完成したファイルでは、抽出されたテキストと OCR で認識されたテキストの区別はつきません。
まずテキストレイヤーの有無を確認する理由
スキャンされた文書は単なる画像です。検索も、テキストのコピーも、編集もできません。OCRは画像を実際のテキストに変換します。古い紙のアーカイブを検索可能にします。スキャンされたフォームからデータを抽出できます。印刷資料を編集可能なファイルに変換します。
契約書、領収書、歴史的文書、書籍のページのデジタル化に不可欠です。スクリーンリーダーは読み上げに実際のテキストを必要とします——OCRはスキャンされた文書をアクセシブルにします。手動での打ち直しに比べて何時間も節約できます。
手元のPDFを見分ける方法
通常のリーダーですでにPDFのテキストを選択してコピーできる場合、そのPDFにはテキストレイヤーが存在し、OCRによる推測が一切入らないため、.txtの出力は埋め込まれたテキストとほぼ一致します。この場合の精度は、PDFが元々どのように作成されたかだけで決まります。
テキストを選択しようとしてもページ全体を囲む四角形がハイライトされるだけ、あるいは何も反応しない場合、そのページはスキャン画像であり、その.txt出力の内容はOCRの精度に左右されます。スキャンされたページが想定より読み取りが悪い場合は、スキャンの解像度と元の書類の鮮明さを確認してください。すでにテキストレイヤーを持つPDF内の表は、各文字の位置がファイルに直接記録されているため通常セルの値が理にかなった読み取り順序で保持されますが、スキャンされたページ上の同じ表はOCRが列を正しくたどれるかどうかに左右されるため、スキャンされた請求書はネイティブPDFからそのまま取り出した場合に比べて後で手作業による並べ直しが必要になる可能性が高くなります。
信頼できるTXT出力を得るには
スキャンされたPDFの場合、入力するスキャンの解像度が高いほど出力されるテキストもきれいになります。自分でスキャンするのであれば300 DPI以上を目安にするとよいでしょう。それより低いと、小さい文字でOCRの精度が落ち始めます。
ネイティブページとスキャンページが混在するPDFの場合、両者の境目付近の.txt出力を確認してください。そこはページ単位の処理が切り替わる唯一の箇所であり、変則的なヘッダーやフッターが区切りマーカー内のページ順を混乱させることがあるためです。ファイルは、あるページが直接抽出によるものかOCRによるものかにかかわらず、全体を通してUnix形式の改行を用いたUTF-8で書き出されるため、結果を読み込むスクリプト側は、テキストが書き出された後は元のページの種類ごとに別々の処理を用意する必要がありません。