Визуализатор структуры PDF-документа

Визуализируйте структуру PDF в браузере: заголовки, абзацы, списки и изображения обведены на каждой странице в порядке чтения, плюс закладки и теги. Экспорт в JSON или Markdown.

PDF

или перетащите файл сюда

PDF

Быстрая конвертацияБезопасная обработкаБез регистрации

Что показывает визуализатор структуры

Загрузите PDF — и каждая страница отрисуется с цветными рамками вокруг каждого найденного блока: заголовков трёх уровней, абзацев, пунктов списков и изображений. У каждой рамки есть номер, а список рядом со страницей повторяет блоки в том же порядке, так что видно, в какой последовательности их прочитает конвертер или экранный диктор.

Нажмите на рамку или на пункт списка, чтобы подсветить его в обоих местах, и включайте или выключайте типы блоков, чтобы сосредоточиться на одном виде элементов. Также выводятся закладки, а для тегированных PDF — теги структуры первой страницы. Если нужна редактируемая копия, а не карта, конвертацию выполнит PDF в Word.

Как распознаются блоки

ЭлементКак распознаётся
ЗаголовкиКороткие блоки, набранные заметно крупнее основного текста. Самый крупный размер становится Заголовком 1, следующий — Заголовком 2, затем Заголовком 3. Одна жирная строка размером с основной текст считается малым заголовком.
АбзацыСтроки одного размера, стоящие близко и перекрывающиеся по горизонтали, объединяются в один блок; больший промежуток или смена размера начинает следующий.
Пункты спискаСтрока, начинающаяся с маркера, тире, цифры или буквы с точкой или скобкой, становится отдельным пунктом списка.
ИзображенияКаждое растровое изображение на странице, измеренное по командам рисования, поэтому рамка соответствует размещённой картинке, а не файлу внутри.
Порядок чтенияБлоки делятся по самому широкому пустому промежутку — вертикальные колонки раньше горизонтальных разрывов, — поэтому две колонки читаются одна за другой под заголовком на всю ширину.

Как визуализировать структуру PDF

  1. Выберите PDF. Первые двадцать страниц отрисовываются и анализируются в браузере.
  2. Листайте страницы. Легенда показывает, сколько блоков каждого типа найдено; нажмите на тип, чтобы скрыть или показать его.
  3. Нажмите на любую рамку, чтобы увидеть её текст, размер шрифта и позицию в списке справа.
  4. Скачайте результат как JSON с координатами рамок или как план в Markdown с заголовками, пунктами списков и заглушками изображений.

Когда полезна такая карта

Перед конвертацией отчёта проверьте, являются ли его заголовки настоящими заголовками и будут ли колонки прочитаны в правильном порядке: если карта выглядит неверно, таким же будет и сконвертированный документ. Для сканов карта остаётся пустой — текстового слоя нет, — и здесь нужен OCR PDF в Word.

План в Markdown — быстрый способ превратить PDF в заметки или оглавление. Когда важен весь текст, а не только его скелет, PDF в Markdown перенесёт и основной текст.

Чего ожидать

Распознавание опирается на геометрию и размеры шрифта, а не на замысел автора. Крупная врезка будет помечена как заголовок, абзац с висячим отступом может разделиться на два, а таблицы отображаются как несколько абзацев или пунктов списка, а не как сетка. Векторные рисунки, например диаграммы, в рамки не берутся — только растровые изображения.

PDF с паролем здесь не открыть — сначала воспользуйтесь разблокировкой PDF. Теги структуры читаются из файла, если они есть, но сами рамки вычисляются по странице, поэтому нетегированный документ тоже получает полную карту. Для формальной проверки тегов и архивного соответствия запустите валидатор PDF/A.

Часто задаваемые вопросы

Анализ происходит в браузере?

Да. Страницы отрисовываются и блоки определяются на вашем устройстве, файлы JSON и Markdown создаются локально. Как в целом обрабатываются загрузки и данные об использовании, описано в политике конфиденциальности.

Почему абзац помечен как заголовок?

Заголовки распознаются по размеру: короткий блок, набранный заметно крупнее основного текста, считается заголовком. Врезка, строка на обложке или крупная буквица проходят тот же тест. Метка описывает, как набрана страница, а не что имел в виду автор.

Что означает номер порядка чтения?

Это последовательность, в которой блоки будут прочитаны при линеаризации страницы: сверху вниз и колонка за колонкой там, где есть колонки. Именно этому порядку, скорее всего, последует конвертер или экранный диктор, поэтому неверный порядок на карте обычно предсказывает неверный порядок в сконвертированном файле.

Почему у моего скана нет блоков?

Скан — это картинка страницы, поэтому единственный блок, который можно найти, — само изображение. Сначала прогоните файл через OCR, чтобы добавить текстовый слой, и заголовки с абзацами станут видны.

Распознаются ли таблицы?

Не как таблицы. Ячейки приходят как небольшие абзацы или пункты списка на месте ячеек — это всё равно показывает порядок чтения, которому последует конвертер. Для извлечения таблиц используйте PDF в Excel.

Что содержится в экспорте JSON?

По одной записи на проанализированную страницу с её размером в пунктах и всеми блоками в порядке чтения: тип, текст, размер шрифта, признак жирного и рамка, отмеренная от левого верхнего угла. Экспорт в Markdown сохраняет только заголовки, пункты списков, абзацы и заглушки изображений.