Что показывает визуализатор структуры
Загрузите PDF — и каждая страница отрисуется с цветными рамками вокруг каждого найденного блока: заголовков трёх уровней, абзацев, пунктов списков и изображений. У каждой рамки есть номер, а список рядом со страницей повторяет блоки в том же порядке, так что видно, в какой последовательности их прочитает конвертер или экранный диктор.
Нажмите на рамку или на пункт списка, чтобы подсветить его в обоих местах, и включайте или выключайте типы блоков, чтобы сосредоточиться на одном виде элементов. Также выводятся закладки, а для тегированных PDF — теги структуры первой страницы. Если нужна редактируемая копия, а не карта, конвертацию выполнит PDF в Word.
Как распознаются блоки
| Элемент | Как распознаётся |
|---|---|
| Заголовки | Короткие блоки, набранные заметно крупнее основного текста. Самый крупный размер становится Заголовком 1, следующий — Заголовком 2, затем Заголовком 3. Одна жирная строка размером с основной текст считается малым заголовком. |
| Абзацы | Строки одного размера, стоящие близко и перекрывающиеся по горизонтали, объединяются в один блок; больший промежуток или смена размера начинает следующий. |
| Пункты списка | Строка, начинающаяся с маркера, тире, цифры или буквы с точкой или скобкой, становится отдельным пунктом списка. |
| Изображения | Каждое растровое изображение на странице, измеренное по командам рисования, поэтому рамка соответствует размещённой картинке, а не файлу внутри. |
| Порядок чтения | Блоки делятся по самому широкому пустому промежутку — вертикальные колонки раньше горизонтальных разрывов, — поэтому две колонки читаются одна за другой под заголовком на всю ширину. |
Как визуализировать структуру PDF
- Выберите PDF. Первые двадцать страниц отрисовываются и анализируются в браузере.
- Листайте страницы. Легенда показывает, сколько блоков каждого типа найдено; нажмите на тип, чтобы скрыть или показать его.
- Нажмите на любую рамку, чтобы увидеть её текст, размер шрифта и позицию в списке справа.
- Скачайте результат как JSON с координатами рамок или как план в Markdown с заголовками, пунктами списков и заглушками изображений.
Когда полезна такая карта
Перед конвертацией отчёта проверьте, являются ли его заголовки настоящими заголовками и будут ли колонки прочитаны в правильном порядке: если карта выглядит неверно, таким же будет и сконвертированный документ. Для сканов карта остаётся пустой — текстового слоя нет, — и здесь нужен OCR PDF в Word.
План в Markdown — быстрый способ превратить PDF в заметки или оглавление. Когда важен весь текст, а не только его скелет, PDF в Markdown перенесёт и основной текст.
Чего ожидать
Распознавание опирается на геометрию и размеры шрифта, а не на замысел автора. Крупная врезка будет помечена как заголовок, абзац с висячим отступом может разделиться на два, а таблицы отображаются как несколько абзацев или пунктов списка, а не как сетка. Векторные рисунки, например диаграммы, в рамки не берутся — только растровые изображения.
PDF с паролем здесь не открыть — сначала воспользуйтесь разблокировкой PDF. Теги структуры читаются из файла, если они есть, но сами рамки вычисляются по странице, поэтому нетегированный документ тоже получает полную карту. Для формальной проверки тегов и архивного соответствия запустите валидатор PDF/A.