PDF文書構造ビジュアライザー

PDFの構造をブラウザで可視化。各ページの見出し、段落、リスト、画像を読み順に枠で示し、ブックマークとタグも一覧。アウトラインをJSONまたはMarkdownで書き出せます。

PDF

またはファイルをここにドラッグ&ドロップ

PDF

高速変換安全な処理登録不要

構造ビジュアライザーが示すもの

PDFをアップロードすると、各ページに検出されたブロックごとに色付きの枠が描かれます。3段階の見出し、段落、リスト項目、画像です。各枠には番号が付き、ページ横の一覧が同じ順序でブロックを並べるので、変換ツールやスクリーンリーダーがたどる順番が分かります。

枠または一覧の項目をクリックすると両方が強調表示され、ブロックの種類をオン・オフして特定の要素だけに絞れます。ブックマークと、タグ付きPDFでは1ページ目の構造タグも一覧表示します。地図ではなく編集できるコピーが目的なら、PDFからWordが変換を行います。

ブロックの検出方法

要素認識のしかた
見出し本文より明らかに大きな文字で組まれた短いブロック。最大サイズが見出し1、次が見出し2、その次が見出し3になります。本文サイズの太字1行は小見出しとして扱います。
段落同じサイズで近接し、水平方向に重なる行は1つのブロックにまとめられます。大きな間隔やサイズの変化で次のブロックが始まります。
リスト項目行頭が箸点、ダッシュ、数字、またはピリオドか括弧付きの文字で始まる行は、それぞれ独立したリスト項目になります。
画像ページに描かれたすべてのラスター画像。描画命令から寸法を測るため、枠は内部のファイルではなく配置された画像に一致します。
読み順ブロックは最も広い空白で分割されます。縦の段間を横の空白より優先するため、全幅の見出しの下にある2段組は段ごとに読まれます。

PDFの構造を可視化する手順

  1. PDFを選択します。最初の20ページがブラウザ内で描画・解析されます。
  2. ページを切り替えます。凡例には種類ごとに見つかったブロック数が表示され、種類をクリックすると表示・非表示を切り替えられます。
  3. 任意の枠をクリックすると、右側の一覧でそのテキスト、文字サイズ、位置を確認できます。
  4. 結果を境界ボックス付きのJSONとして、または見出し・リスト項目・画像プレースホルダーを保つMarkdownアウトラインとしてダウンロードします。

この地図が役立つ場面

レポートを変換する前に、見出しが本当に見出しとして扱われるか、段組が正しい順序で読まれるかを確認してください。地図が間違っていれば、変換後の文書も間違います。スキャン文書ではテキスト層がないため地図は空のままで、OCR PDFからWordを使うのが適切です。

Markdownアウトラインは、PDFをメモや目次に変える手早い方法です。骨格ではなく本文全体が必要なら、PDFからMarkdownが本文も引き継ぎます。

知っておきたいこと

検出は幾何情報と文字サイズに基づき、著者の意図は考慮しません。大きな引用は見出しと判定され、ぶら下げインデントの段落は2つに割れることがあり、表は格子ではなく複数の段落やリスト項目として現れます。グラフなどのベクター図形は枠で囲まれず、ラスター画像だけが対象です。

パスワード付きPDFはここでは開けないので、先にPDFのロック解除を使ってください。構造タグはファイルにあれば読み取りますが、枠自体はページから計算するため、タグのない文書でも完全な地図が得られます。タグ付けとアーカイブ適合性を正式に検証するにはPDF/Aバリデーターを実行してください。

よくある質問

解析はブラウザ内で行われますか?

はい。ページの描画とブロックの検出はお使いの端末上で行われ、JSONとMarkdownのダウンロードもローカルで生成されます。アップロードや利用データの一般的な取り扱いはプライバシーポリシーに記載しています。

段落が見出しと判定されるのはなぜですか?

見出しはサイズで認識します。本文より明らかに大きな文字で組まれた短いブロックは見出しと見なされます。引用、表紙の一行、大きなドロップキャップも同じ条件を満たします。ラベルはページがどう組まれているかを表すもので、著者の意図の判定ではありません。

読み順の番号は何を意味しますか?

ページを線形化した場合にブロックが読まれる順序です。上から下へ、段組があれば段ごとに進みます。変換ツールやスクリーンリーダーがたどる可能性の高い順序なので、地図上で順序が誤っていれば変換後のファイルでも誤っていることがほとんどです。

スキャンしたPDFにブロックが表示されないのはなぜですか?

スキャンはページの画像なので、ツールが見つけられるブロックは画像そのものだけです。まずOCRでテキスト層を追加すると、見出しや段落が表示されるようになります。

表は検出されますか?

表としては検出されません。セルはセルの位置にある小さな段落やリスト項目として現れますが、それでも変換ツールがたどる読み順は確認できます。表の抽出にはPDFからExcelを使ってください。

JSON書き出しには何が含まれますか?

解析した各ページについて、ポイント単位のサイズと読み順に並んだ全ブロックが1件ずつ入ります。種類、テキスト、文字サイズ、太字フラグ、左上を原点とする境界ボックスです。Markdown書き出しには見出し、リスト項目、段落、画像プレースホルダーだけが残ります。