Co pokazuje wizualizator struktury
Prześlij PDF, a każda strona zostanie narysowana z kolorowymi ramkami wokół każdego znalezionego bloku: nagłówków na trzech poziomach, akapitów, elementów list i obrazów. Każda ramka ma numer, a lista obok strony powtarza bloki w tej kolejności, więc widzisz sekwencję, którą podążyłby konwerter lub czytnik ekranu.
Kliknij ramkę lub pozycję na liście, aby podświetlić ją w obu miejscach, i włączaj lub wyłączaj typy bloków, aby skupić się na jednym rodzaju elementów. Wypisywane są też zakładki, a w PDF-ach z tagami — tagi struktury pierwszej strony. Jeśli celem jest edytowalna kopia, a nie mapa, konwersję wykona PDF do Word.
Jak wykrywane są bloki
| Element | Jak jest rozpoznawany |
|---|---|
| Nagłówki | Krótkie bloki złożone wyraźnie większym stopniem niż tekst główny. Największy rozmiar staje się Nagłówkiem 1, następny Nagłówkiem 2, potem Nagłówkiem 3. Pojedyncza pogrubiona linia w rozmiarze tekstu głównego jest traktowana jako nagłówek niższego rzędu. |
| Akapity | Linie tego samego rozmiaru, leżące blisko siebie i nachodzące na siebie w poziomie, są łączone w jeden blok; większy odstęp lub zmiana rozmiaru zaczyna następny. |
| Elementy listy | Linia zaczynająca się od punktora, myślnika, liczby lub litery z kropką albo nawiasem staje się osobnym elementem listy. |
| Obrazy | Każdy obraz rastrowy narysowany na stronie, zmierzony z instrukcji rysowania, więc ramka odpowiada umieszczonemu obrazowi, a nie plikowi w środku. |
| Kolejność czytania | Bloki są dzielone po najszerszej pustej przerwie — pionowe łamy przed poziomymi odstępami — dzięki czemu dwie kolumny pod tytułem na całą szerokość są czytane kolumna po kolumnie. |
Jak zwizualizować strukturę PDF
- Wybierz PDF. Pierwsze dwadzieścia stron jest renderowanych i analizowanych w przeglądarce.
- Przechodź między stronami. Legenda pokazuje, ile bloków każdego typu znaleziono; kliknij typ, aby go ukryć lub pokazać.
- Kliknij dowolną ramkę, aby zobaczyć jej tekst, rozmiar czcionki i pozycję na liście po prawej.
- Pobierz wynik jako JSON z ramkami albo jako konspekt Markdown zachowujący nagłówki, elementy list i miejsca na obrazy.
Kiedy mapa się przydaje
Przed konwersją raportu sprawdź, czy jego nagłówki są prawdziwymi nagłówkami i czy kolumny zostaną przeczytane we właściwej kolejności; jeśli mapa wygląda źle, skonwertowany dokument też będzie zły. Dla skanów mapa pozostaje pusta, bo nie ma warstwy tekstowej, i właściwym narzędziem jest OCR PDF do Word.
Konspekt Markdown to szybki sposób na zamianę PDF w notatki lub spis treści. Gdy liczy się cały tekst, a nie tylko jego szkielet, PDF do Markdown przenosi też treść.
Czego się spodziewać
Wykrywanie opiera się na geometrii i rozmiarach czcionek, nie na zamiarze autora. Duży cytat wyróżniony zostanie oznaczony jako nagłówek, akapit z wysunięciem może rozpaść się na dwa, a tabele pojawiają się jako kilka akapitów lub elementów listy, a nie jako siatka. Rysunki wektorowe, takie jak wykresy, nie są obramowane; tylko obrazy rastrowe.
PDF-ów zabezpieczonych hasłem nie da się tu otworzyć; najpierw użyj Odblokuj PDF. Tagi struktury są odczytywane z pliku, gdy istnieją, ale same ramki są liczone ze strony, więc dokument bez tagów też otrzymuje pełną mapę. Aby formalnie sprawdzić tagowanie i zgodność archiwalną, uruchom walidator PDF/A.