PDFのテキストをコピー用に抽出
スキャンされたPDF、写真、画像をアップロードしてください。OCRはピクセルからテキストを読み取り、編集可能な文字に変換します。複数言語の印刷テキストに対応しています。低画質のスキャン、傾いたページ、さまざまなフォントにも対応します。
ページは元の順序のまま、間に区切りを入れて並ぶため、ページ数の多い大きな PDF でも 1 つの連続したテキストとして戻ってきます。ざっと目を通して、本当に必要な部分だけをコピーできます。結果を貼り付ける場所によって改行の扱いも変わります。プレーンテキストの入力欄では元の各行が別々に保たれますが、リッチテキストの貼り付け先の中には短い行を 1 つの段落にまとめてしまうものもあります。貼り付け直後に段組みのページが詰まって見える場合は、貼り付け先を一度確認してください。
可能な限りOCRを省く理由
スキャンされた文書は単なる画像です。検索も、テキストのコピーも、編集もできません。OCRは画像を実際のテキストに変換します。古い紙のアーカイブを検索可能にします。スキャンされたフォームからデータを抽出できます。印刷資料を編集可能なファイルに変換します。
契約書、領収書、歴史的文書、書籍のページのデジタル化に不可欠です。スクリーンリーダーは読み上げに実際のテキストを必要とします——OCRはスキャンされた文書をアクセシブルにします。手動での打ち直しに比べて何時間も節約できます。
元のPDFを見極める
通常のビューアですでにテキストを選択できるPDFであれば、認識処理による推測を挟まない直接抽出になるため、ほぼそのままの形で返ってきます。この場合の精度は元ファイルのエンコーディング次第ですが、たいてい非常に良好です。
テキストを選択しようとしてもページ全体に四角い枠が付くだけで、実際には何も選択できないPDFはスキャンであり、そうしたページのコピー結果は画像を読み取るOCRの精度に左右されます。行がおかしいと感じたら、全面的に信用する前に元のPDFと照らし合わせて確認してください。表の数値は、すでにテキストを保持しているPDFから取得する場合には各文字の位置がファイル自体に記録されているため扱いやすい順序で並びますが、スキャンされたページから同じ表を取り出す場合はOCRが列の境界を正しく判断できるかどうかに左右され、境界の判断を誤ると数字が本来とは違うラベルの隣に置かれてしまいます。
結果をコピーする前に
PDFがスキャンの場合、手書きより印刷、色あせているよりコントラストがはっきりしている、より鮮明な元原稿の方がOCRにとって手がかりが多く、コピーするテキストの誤りも少なくなります。ここには認識ミスを和らげてくれる書式のフォールバックがないためです。
長いPDFの場合は、返されたテキスト内のページ区切りを使って必要な箇所に直接ジャンプする方が、先頭から最後まで読み通すよりも効率的です。必要なのが1ページだけなら、全ページ分のコピーをスクロールして探すより、たいていその方が速く済みます。