構造ビジュアライザーが示すもの
PDFをアップロードすると、各ページに検出されたブロックごとに色付きの枠が描かれます。3段階の見出し、段落、リスト項目、画像です。各枠には番号が付き、ページ横の一覧が同じ順序でブロックを並べるので、変換ツールやスクリーンリーダーがたどる順番が分かります。
枠または一覧の項目をクリックすると両方が強調表示され、ブロックの種類をオン・オフして特定の要素だけに絞れます。ブックマークと、タグ付きPDFでは1ページ目の構造タグも一覧表示します。地図ではなく編集できるコピーが目的なら、PDFからWordが変換を行います。
ブロックの検出方法
| 要素 | 認識のしかた |
|---|---|
| 見出し | 本文より明らかに大きな文字で組まれた短いブロック。最大サイズが見出し1、次が見出し2、その次が見出し3になります。本文サイズの太字1行は小見出しとして扱います。 |
| 段落 | 同じサイズで近接し、水平方向に重なる行は1つのブロックにまとめられます。大きな間隔やサイズの変化で次のブロックが始まります。 |
| リスト項目 | 行頭が箸点、ダッシュ、数字、またはピリオドか括弧付きの文字で始まる行は、それぞれ独立したリスト項目になります。 |
| 画像 | ページに描かれたすべてのラスター画像。描画命令から寸法を測るため、枠は内部のファイルではなく配置された画像に一致します。 |
| 読み順 | ブロックは最も広い空白で分割されます。縦の段間を横の空白より優先するため、全幅の見出しの下にある2段組は段ごとに読まれます。 |
PDFの構造を可視化する手順
- PDFを選択します。最初の20ページがブラウザ内で描画・解析されます。
- ページを切り替えます。凡例には種類ごとに見つかったブロック数が表示され、種類をクリックすると表示・非表示を切り替えられます。
- 任意の枠をクリックすると、右側の一覧でそのテキスト、文字サイズ、位置を確認できます。
- 結果を境界ボックス付きのJSONとして、または見出し・リスト項目・画像プレースホルダーを保つMarkdownアウトラインとしてダウンロードします。
この地図が役立つ場面
レポートを変換する前に、見出しが本当に見出しとして扱われるか、段組が正しい順序で読まれるかを確認してください。地図が間違っていれば、変換後の文書も間違います。スキャン文書ではテキスト層がないため地図は空のままで、OCR PDFからWordを使うのが適切です。
Markdownアウトラインは、PDFをメモや目次に変える手早い方法です。骨格ではなく本文全体が必要なら、PDFからMarkdownが本文も引き継ぎます。
知っておきたいこと
検出は幾何情報と文字サイズに基づき、著者の意図は考慮しません。大きな引用は見出しと判定され、ぶら下げインデントの段落は2つに割れることがあり、表は格子ではなく複数の段落やリスト項目として現れます。グラフなどのベクター図形は枠で囲まれず、ラスター画像だけが対象です。
パスワード付きPDFはここでは開けないので、先にPDFのロック解除を使ってください。構造タグはファイルにあれば読み取りますが、枠自体はページから計算するため、タグのない文書でも完全な地図が得られます。タグ付けとアーカイブ適合性を正式に検証するにはPDF/Aバリデーターを実行してください。