PDF-Dokumentstruktur visualisieren

PDF-Struktur im Browser visualisieren: Überschriften, Absätze, Listen und Bilder auf jeder Seite in Lesereihenfolge umrandet, dazu Lesezeichen und Tags. Export als JSON oder Markdown.

PDF

oder Datei hierher ziehen

PDF

Schnelle KonvertierungSichere VerarbeitungKeine Registrierung

Was der Strukturvisualisierer zeigt

Laden Sie eine PDF hoch, und jede Seite wird mit farbigen Rahmen um jeden gefundenen Block gezeichnet: Überschriften auf drei Ebenen, Absätze, Listenpunkte und Bilder. Jeder Rahmen trägt eine Nummer, und die Liste neben der Seite wiederholt die Blöcke in dieser Reihenfolge, sodass Sie die Abfolge sehen, der ein Konverter oder ein Screenreader folgen würde.

Klicken Sie auf einen Rahmen oder einen Listeneintrag, um ihn an beiden Stellen hervorzuheben, und schalten Sie Blocktypen ein und aus, um sich auf eine Art von Element zu konzentrieren. Lesezeichen und, bei getaggten PDFs, die Struktur-Tags der ersten Seite werden ebenfalls aufgeführt. Wenn Sie eine bearbeitbare Kopie statt einer Karte brauchen, übernimmt PDF in Word die Konvertierung.

Wie Blöcke erkannt werden

ElementSo wird es erkannt
ÜberschriftenKurze Blöcke, die deutlich größer als der Fließtext gesetzt sind. Die größte Größe wird Überschrift 1, die nächste Überschrift 2, dann Überschrift 3. Eine einzelne fette Zeile in Fließtextgröße gilt als kleine Überschrift.
AbsätzeZeilen gleicher Größe, die eng beieinander stehen und sich horizontal überlappen, werden zu einem Block verbunden; ein größerer Abstand oder ein Größenwechsel beginnt den nächsten.
ListenpunkteEine Zeile, die mit einem Aufzählungszeichen, einem Gedankenstrich, einer Zahl oder einem Buchstaben mit Punkt oder Klammer beginnt, wird zu einem eigenen Listenpunkt.
BilderJedes auf der Seite gezeichnete Rasterbild, gemessen anhand der Zeichenanweisungen, sodass der Rahmen dem platzierten Bild entspricht und nicht der Datei darin.
LesereihenfolgeBlöcke werden an der breitesten leeren Lücke geteilt, senkrechte Spaltenzwischenräume vor waagerechten Abständen, sodass zwei Spalten unter einem seitenbreiten Titel Spalte für Spalte gelesen werden.

So visualisieren Sie die Struktur einer PDF

  1. Wählen Sie eine PDF aus. Die ersten zwanzig Seiten werden in Ihrem Browser gerendert und analysiert.
  2. Blättern Sie durch die Seiten. Die Legende zeigt, wie viele Blöcke jedes Typs gefunden wurden; klicken Sie auf einen Typ, um ihn aus- oder einzublenden.
  3. Klicken Sie auf einen Rahmen, um Text, Schriftgröße und Position in der Liste rechts zu sehen.
  4. Laden Sie das Ergebnis als JSON mit Begrenzungsrahmen herunter oder als Markdown-Gliederung mit Überschriften, Listenpunkten und Bildplatzhaltern.

Wann die Karte nützlich ist

Prüfen Sie vor der Konvertierung eines Berichts, ob seine Überschriften echte Überschriften sind und ob die Spalten in der richtigen Reihenfolge gelesen werden; sieht die Karte falsch aus, wird es das konvertierte Dokument auch. Bei gescannten Dokumenten bleibt die Karte leer, weil es keine Textebene gibt, und OCR PDF in Word ist das passende Werkzeug.

Die Markdown-Gliederung ist ein schneller Weg, aus einer PDF Notizen oder ein Inhaltsverzeichnis zu machen. Wenn der gesamte Text zählt und nicht nur sein Gerüst, überträgt PDF in Markdown auch den Fließtext.

Was Sie erwarten können

Die Erkennung arbeitet mit Geometrie und Schriftgrößen, nicht mit der Absicht des Autors. Ein großes Zitat wird als Überschrift bezeichnet, ein Absatz mit hängendem Einzug kann in zwei zerfallen, und Tabellen erscheinen als mehrere Absätze oder Listenpunkte statt als Raster. Vektorgrafiken wie Diagramme werden nicht umrahmt, nur Rasterbilder.

Passwortgeschützte PDFs lassen sich hier nicht öffnen; nutzen Sie zuerst PDF entsperren. Struktur-Tags werden aus der Datei gelesen, wenn vorhanden, die Rahmen selbst aber aus der Seite berechnet, sodass auch ein ungetaggtes Dokument eine vollständige Karte erhält. Um Tagging und Archivkonformität formal zu prüfen, nutzen Sie den PDF/A-Validator.

Häufig gestellte Fragen

Findet die Analyse in meinem Browser statt?

Ja. Die Seiten werden auf Ihrem Gerät gerendert und die Blöcke dort erkannt; die JSON- und Markdown-Downloads entstehen lokal. Wie Uploads und Nutzungsdaten allgemein behandelt werden, steht in der Datenschutzerklärung.

Warum wird ein Absatz als Überschrift bezeichnet?

Überschriften werden an der Größe erkannt: Ein kurzer Block, der deutlich größer als der Fließtext gesetzt ist, zählt als Überschrift. Ein herausgestelltes Zitat, eine Titelzeile oder eine große Initiale besteht denselben Test. Die Bezeichnung beschreibt, wie die Seite gesetzt ist, nicht, was der Autor meinte.

Was bedeutet die Nummer der Lesereihenfolge?

Sie ist die Abfolge, in der die Blöcke gelesen würden, wenn die Seite linearisiert wird: von oben nach unten und Spalte für Spalte, wo die Seite Spalten hat. Es ist die Reihenfolge, der ein Konverter oder ein Screenreader wahrscheinlich folgt; deshalb sagt eine falsche Reihenfolge auf der Karte meist eine falsche Reihenfolge in der konvertierten Datei voraus.

Warum zeigt meine gescannte PDF keine Blöcke?

Ein Scan ist ein Bild einer Seite, der einzige Block, den das Werkzeug finden kann, ist also das Bild selbst. Schicken Sie die Datei zuerst durch OCR, um eine Textebene hinzuzufügen; danach werden Überschriften und Absätze sichtbar.

Werden Tabellen erkannt?

Nicht als Tabellen. Zellen erscheinen als kleine Absätze oder Listenpunkte an den Stellen der Zellen, was dennoch die Lesereihenfolge zeigt, die ein Konverter nehmen wird. Für die Tabellenextraktion nutzen Sie PDF in Excel.

Was enthält der JSON-Export?

Einen Eintrag pro analysierter Seite mit ihrer Größe in Punkt und jedem Block in Lesereihenfolge: Typ, Text, Schriftgröße, Fett-Kennzeichen und ein Begrenzungsrahmen, gemessen von der linken oberen Ecke. Der Markdown-Export behält nur Überschriften, Listenpunkte, Absätze und Bildplatzhalter.