光学文字認識
OCR(光学文字認識)は、テキストの画像を実際の編集可能なテキストに変換します。スキャンされたドキュメント、ページの写真、画像ベースのPDFは、OCR処理後に検索可能で編集可能になります。当社のツールは複数の言語のテキストを認識し、ドキュメントのレイアウトを保持し、選択した形式で出力します:元と同じ外観で選択可能なテキストを持つ検索可能なPDF、または完全なコンテンツ編集用の編集可能なWordドキュメント。紙のアーカイブのデジタル化、スキャンからのデータ抽出、ドキュメントのアクセシビリティ向上に最適です。
OCR技術の仕組み
光学文字認識(OCR)は画像を解析して文字を見つけます。エンジンは文字領域、行、単語、個々の文字を見つけ出し、それぞれの形を既知のパターンと照合して、どの文字・数字・記号かを判断します。画像はアップロードされたまま読み取られ、傾きや明るさの自動補正はないため、まっすぐで均一に照らされたスキャンが最もよい結果になります。
現在のOCRは、数百万件の文書サンプルで学習した機械学習モデルを使用しています。これらのモデルは、さまざまなフォント、サイズ、スタイルの文字を高い精度で認識できます。コピーの劣化、色あせた文書、低解像度のスキャンといった、従来のOCRシステムでは読み取りに苦労していたテキストも扱えます。
OCRのための文書品質の最適化
スキャンの品質はOCRの精度に直接影響します。信頼できる文字認識には十分な情報量が必要なため、300DPI(1インチあたりのドット数)以上を目安にしてください。スキャン時にはスキャナーのガラス面を掃除し、汚れやすじが入らないようにしてください。文字行の検出を妨げる傾きを最小限にするため、文書は平らでまっすぐな状態で置いてください。
文書を写真で撮影する場合は、テキスト全体に影が入らない均一な照明を確保してください。パースの歪みを避けるため、カメラは文書の面と平行に保ってください。文書の端でしっかりトリミングし、圧縮ノイズが文字周りに生じるJPEGではなく、ロスレスなPNG形式で保存してください。
検索可能なPDFと編集可能なDOCX、どちらを選ぶべきか
検索可能なPDF出力は、元の文書の見た目をそのまま保ちながら、目に見えないテキスト層を追加します。これにより、文書内を検索したり、テキストを選択・コピーしたりできる一方、元のスキャンの見た目をそのまま維持できます。歴史的文書や法的記録など、見た目の忠実さが重要な文書の保存に最適です。
DOCX出力では、テキスト、書式、レイアウトを変更できる完全に編集可能な文書が作成されます。OCRエンジンは、段落構成、フォント、基本的な書式を再現しようとします。内容を修正したり、一部を抜き出して再利用したり、スキャンしたテキストを他の文書に組み込んだりしたい場合はDOCXを使用してください。
複数ページ文書のOCR
複数ページ対応のOCRツールで、文書一式をまとめて処理できます。ページ画像をページ順の名前で1つのZIPに入れれば、検索可能なPDF、Word文書、全ページのテキストのいずれかで1つの結果が得られます。書籍、報告書、書簡、保管記録のデジタル化に最適です。
大きな文書の場合、一括処理はページごとの変換に比べて大幅な時間の節約になります。本ツールはページの順序を保ち、ページごとに異なる画像品質にも対応し、確認してすぐに使えるまとまった出力を生成します。各ページの元のレイアウトは出力にも保持されます。
OCRの対応言語
選んだ言語によって、どの認識モデルがファイルを読むかが決まります。各モデルが扱える文字の系統は一つだけです。ロシア語のページを英語として読み取ると、意味を持たない文字列が返ってきます。そのため、この選択はこのページのどの設定よりも重みがあります。「自動」を選べば、この判断を任せられます。ページごとに文字体系(ラテン文字、キリル文字、ギリシャ文字、アラビア文字、デーヴァナーガリー、タイ文字、ハングル、中国語、日本語)を見分け、対応するモデルを使います。繁体字中国語だけは手動で選ぶのがおすすめです。
ページごとに言語が異なる文書も、「自動」なら分割する必要はありません。各ページがそれぞれのモデルで読み取られます。一方、1ページの中にある別の文字体系の行は、そのページのモデルで読み取られます。そうしたページでは主要な言語を選ぶか、別の言語の部分を独立したページに分けてください。専門的な内容(医療、法務、技術分野)で最良の結果を得るには、専門用語で多少の誤りが生じることを想定しておいてください。
OCRのよくある活用場面
ビジネスの現場では、契約書、請求書、領収書、通信文を検索可能なアーカイブにするためデジタル化します。法務チームは、全文検索のために案件ファイルや開示文書を変換します。医療機関は患者記録や医療フォームをデジタル化します。教育機関は歴史的文書、研究資料、希少な出版物をアーカイブします。
行政機関は公文書を検索・閲覧しやすくします。研究者は歴史的な新聞、原稿、印刷アーカイブからテキストを抽出します。会計士は財務記録を分析用にデジタル化します。紙の文書を扱うあらゆる業務が、OCRによるデジタル化の恩恵を受けられます。
OCRと直接変換、どちらが必要か
PDFからWordへの変換すべてにOCRが必要なわけではありません。Wordからエクスポートされた、ソフトウェアで生成された、あるいはデジタルテキストから作成されたなど、PDFがデジタルに作成されたものであれば、すでに抽出可能なテキストを含んでいます。本サイトのPDFからWordへの変換ツールのような直接変換ツールは、このテキスト層を素早く正確に抽出します。こうした文書にOCRは不要であり、むしろ品質を下げてしまいます。
PDFが画像しか含んでいない場合、つまりスキャンされた紙の文書、撮影されたページ、ファックス、画像ファイルから作成されたPDFの場合は、OCRが欠かせません。これらは見た目にはテキストのように見えますが、実際のテキストデータは含まれておらず、単なる文字の絵にすぎません。本サイトのOCRツールはこれらの画像を解析し、文字を認識して、本物の編集可能なテキストを作成します。PDF内でテキストを選択できない場合は、OCRが必要です。
スキャンされた文書の扱い方について詳しくは、スキャンされたPDFをOCRで編集可能なWord文書に変換する方法についての詳細ガイドをご覧ください。準備のコツ、品質の最適化、よくある問題のトラブルシューティングを扱っています。 Learn more about OCR for scanned PDFs
最良のOCR結果を得るためのヒント
事前の準備はOCRの精度に大きく影響します。スキャンする場合は、白地に黒文字で最低300DPIの解像度を使用してください。スキャナーのガラス面を掃除し、ページをまっすぐに揃え、影や折れじわを避けてください。写真で撮影する場合は、均一な照明を確保し、カメラを文書と平行に保ち、最高解像度の設定を使用してください。
処理前に正しい文書の言語を選択してください。これにより言語ごとの辞書や文字パターンが有効になります。変換後は、特に数字、固有名詞、専門用語について、必ず出力内容を校正してください。OCRは0とO、1とlとI、rnとmのような似た文字を混同することがあります。スペルチェックは出発点として使えますが、重要なデータは手作業で確認してください。