Wizualizator struktury dokumentu PDF

Zwizualizuj strukturę PDF w przeglądarce: nagłówki, akapity, listy i obrazy obrysowane na każdej stronie w kolejności czytania, plus zakładki i tagi. Eksport do JSON lub Markdown.

PDF

lub przeciągnij i upuść plik tutaj

PDF

Szybka konwersjaBezpieczne przetwarzanieBez rejestracji

Co pokazuje wizualizator struktury

Prześlij PDF, a każda strona zostanie narysowana z kolorowymi ramkami wokół każdego znalezionego bloku: nagłówków na trzech poziomach, akapitów, elementów list i obrazów. Każda ramka ma numer, a lista obok strony powtarza bloki w tej kolejności, więc widzisz sekwencję, którą podążyłby konwerter lub czytnik ekranu.

Kliknij ramkę lub pozycję na liście, aby podświetlić ją w obu miejscach, i włączaj lub wyłączaj typy bloków, aby skupić się na jednym rodzaju elementów. Wypisywane są też zakładki, a w PDF-ach z tagami — tagi struktury pierwszej strony. Jeśli celem jest edytowalna kopia, a nie mapa, konwersję wykona PDF do Word.

Jak wykrywane są bloki

ElementJak jest rozpoznawany
NagłówkiKrótkie bloki złożone wyraźnie większym stopniem niż tekst główny. Największy rozmiar staje się Nagłówkiem 1, następny Nagłówkiem 2, potem Nagłówkiem 3. Pojedyncza pogrubiona linia w rozmiarze tekstu głównego jest traktowana jako nagłówek niższego rzędu.
AkapityLinie tego samego rozmiaru, leżące blisko siebie i nachodzące na siebie w poziomie, są łączone w jeden blok; większy odstęp lub zmiana rozmiaru zaczyna następny.
Elementy listyLinia zaczynająca się od punktora, myślnika, liczby lub litery z kropką albo nawiasem staje się osobnym elementem listy.
ObrazyKażdy obraz rastrowy narysowany na stronie, zmierzony z instrukcji rysowania, więc ramka odpowiada umieszczonemu obrazowi, a nie plikowi w środku.
Kolejność czytaniaBloki są dzielone po najszerszej pustej przerwie — pionowe łamy przed poziomymi odstępami — dzięki czemu dwie kolumny pod tytułem na całą szerokość są czytane kolumna po kolumnie.

Jak zwizualizować strukturę PDF

  1. Wybierz PDF. Pierwsze dwadzieścia stron jest renderowanych i analizowanych w przeglądarce.
  2. Przechodź między stronami. Legenda pokazuje, ile bloków każdego typu znaleziono; kliknij typ, aby go ukryć lub pokazać.
  3. Kliknij dowolną ramkę, aby zobaczyć jej tekst, rozmiar czcionki i pozycję na liście po prawej.
  4. Pobierz wynik jako JSON z ramkami albo jako konspekt Markdown zachowujący nagłówki, elementy list i miejsca na obrazy.

Kiedy mapa się przydaje

Przed konwersją raportu sprawdź, czy jego nagłówki są prawdziwymi nagłówkami i czy kolumny zostaną przeczytane we właściwej kolejności; jeśli mapa wygląda źle, skonwertowany dokument też będzie zły. Dla skanów mapa pozostaje pusta, bo nie ma warstwy tekstowej, i właściwym narzędziem jest OCR PDF do Word.

Konspekt Markdown to szybki sposób na zamianę PDF w notatki lub spis treści. Gdy liczy się cały tekst, a nie tylko jego szkielet, PDF do Markdown przenosi też treść.

Czego się spodziewać

Wykrywanie opiera się na geometrii i rozmiarach czcionek, nie na zamiarze autora. Duży cytat wyróżniony zostanie oznaczony jako nagłówek, akapit z wysunięciem może rozpaść się na dwa, a tabele pojawiają się jako kilka akapitów lub elementów listy, a nie jako siatka. Rysunki wektorowe, takie jak wykresy, nie są obramowane; tylko obrazy rastrowe.

PDF-ów zabezpieczonych hasłem nie da się tu otworzyć; najpierw użyj Odblokuj PDF. Tagi struktury są odczytywane z pliku, gdy istnieją, ale same ramki są liczone ze strony, więc dokument bez tagów też otrzymuje pełną mapę. Aby formalnie sprawdzić tagowanie i zgodność archiwalną, uruchom walidator PDF/A.

Najczęściej zadawane pytania

Czy analiza odbywa się w mojej przeglądarce?

Tak. Strony są renderowane, a bloki wykrywane na Twoim urządzeniu; pliki JSON i Markdown powstają lokalnie. Polityka prywatności opisuje ogólne zasady przetwarzania przesłanych plików i danych o użyciu.

Dlaczego akapit został oznaczony jako nagłówek?

Nagłówki są rozpoznawane po rozmiarze: krótki blok złożony wyraźnie większym stopniem niż tekst główny liczy się jako nagłówek. Wyróżniony cytat, linia na okładce czy duży inicjał przechodzą ten sam test. Etykieta opisuje, jak strona jest złożona, a nie co miał na myśli autor.

Co oznacza numer kolejności czytania?

To sekwencja, w jakiej bloki byłyby czytane po zlinearyzowaniu strony: od góry do dołu i kolumna po kolumnie tam, gdzie strona ma kolumny. To kolejność, którą prawdopodobnie przyjmie konwerter lub czytnik ekranu, dlatego zła kolejność na mapie zwykle zapowiada złą kolejność w skonwertowanym pliku.

Dlaczego mój zeskanowany PDF nie pokazuje bloków?

Skan to obraz strony, więc jedynym blokiem, jaki narzędzie może znaleźć, jest sam obraz. Najpierw przepuść plik przez OCR, aby dodać warstwę tekstową — wtedy nagłówki i akapity staną się widoczne.

Czy tabele są wykrywane?

Nie jako tabele. Komórki pojawiają się jako małe akapity lub elementy listy w miejscach komórek, co i tak pokazuje kolejność czytania, jaką przyjmie konwerter. Do wyciągania tabel użyj PDF do Excel.

Co zawiera eksport JSON?

Jeden wpis na przeanalizowaną stronę z jej rozmiarem w punktach i każdym blokiem w kolejności czytania: typ, tekst, rozmiar czcionki, znacznik pogrubienia i ramka mierzona od lewego górnego rogu. Eksport Markdown zachowuje tylko nagłówki, elementy list, akapity i miejsca na obrazy.