Как работает конвертация PDF в CSV
Конвертер ищет в PDF таблицы, определяет по положению текста и разделительным линиям, где проходят строки и столбцы, и записывает ячейки в файл CSV.
Когда в PDF несколько таблиц, каждая записывается вслед за предыдущей со строкой заголовка, которая называет её страницу, так что вы можете разделить файл или удалить ненужные части.
Почему CSV, а не Excel
CSV — это обычный текст, именно то, что нужно скрипту, импорту в базу данных или инструменту для работы с данными. Ничему не приходится разбирать табличный формат, чтобы это прочитать.
Он также открывается в Excel, Google Sheets, Numbers и LibreOffice Calc. Выберите вместо него наш инструмент PDF в Excel, если вам нужны форматирование, объединённые ячейки и по одному листу на таблицу.
Типичные сценарии
Перенос банковской выписки, прайс-листа или таблицы из отчёта в электронную таблицу без ручного перенабора строк.
Загрузка цифр из опубликованного PDF в скрипт или базу данных, где CSV — самый короткий путь от документа до вашего запроса.
Чего ожидать от результата
Файл в UTF-8 с маркером порядка байтов, поэтому диакритика и нелатинский текст открываются в Excel по двойному щелчку корректно. Значения, в которых есть запятая или кавычка, заключаются в кавычки так, как требует стандарт CSV.
В CSV нет места объединённым ячейкам, цветам и нескольким листам, поэтому объединённый заголовок записывается в первую из своих ячеек. В PDF без текстового слоя нет таблицы, которую инструмент мог бы найти, и ему сначала нужен OCR.
Советы для более чистых таблиц
Таблицы с разделительными линиями конвертируются точнее всего, потому что линии прямо говорят инструменту, где заканчивается каждый столбец.
Откройте CSV и сверьте первую и последнюю строку с PDF. Пропавшая последняя строка обычно означает, что таблица продолжалась на странице, которую экстрактор счёл отдельной.