Извлекаем текст PDF для копирования
OCR (оптическое распознавание символов) анализирует изображения текста и преобразует их в фактические редактируемые символы. Когда вы загружаете отсканированный документ или фотографию, движок OCR исследует шаблоны пикселей для идентификации букв, цифр и символов. Современный OCR использует продвинутые алгоритмы для распознавания текста даже в сложных условиях: низкое разрешение, перекошенные страницы, различные шрифты и сложные макеты с колонками, таблицами и смешанным содержимым.
Страницы сохраняют исходный порядок и разделены меткой, поэтому даже большой многостраничный PDF возвращается одним сплошным блоком текста, который можно просмотреть и скопировать нужную часть. То, куда вы вставляете результат, влияет и на переносы строк: обычное текстовое поле сохраняет каждую исходную строку отдельно, а некоторые редакторы с форматированием склеивают короткие строки в один абзац, поэтому проверьте место вставки, если многоколоночная страница сразу после вставки выглядит слипшейся.
Почему это пропускает OCR, когда можно
Отсканированные документы и PDF на основе изображений содержат только картинки текста — вы не можете искать, копировать или редактировать их. OCR преобразует эти изображения в реальный текст, делая документы поисковыми, редактируемыми и доступными. Когда вам нужно найти конкретное содержимое среди тысяч отсканированных страниц, OCR делает это возможным. Цифровые архивы, системы управления документами и рабочие процессы комплаенса зависят от OCR для превращения отсканированного содержимого в полезное.
Помимо поиска, OCR позволяет извлекать данные из бумажных документов: оцифровывать контракты для анализа, извлекать данные из форм, конвертировать печатные материалы в редактируемый текст для повторного использования. Требования доступности часто требуют поискового текста для пользователей с нарушениями зрения, использующих программы чтения с экрана. OCR соединяет бумажные архивы и цифровые рабочие процессы.
Оцениваем исходный PDF
PDF, в котором текст уже можно выделить в обычной программе просмотра, вернётся почти дословно, поскольку это прямое извлечение без каких-либо догадок распознавания; качество здесь ограничено только тем, насколько хорошо изначально закодирован файл, а это обычно очень хорошо.
PDF, в котором попытка выделить текст просто рисует рамку вокруг страницы, а выделить по-настоящему ничего нельзя, — это скан, и скопированный результат для таких страниц зависит от того, как OCR прочитает картинку; сверьте такую страницу с исходным PDF, если строка выглядит подозрительно, прежде чем полностью ей доверять. Числа в таблице попадают в удобный порядок, если они взяты из PDF, который уже хранит текст, поскольку позиция каждого символа записана прямо в файле, но та же таблица, снятая со сканированной страницы, зависит от того, правильно ли OCR определит границы столбцов, и ошибочно определённая граница проявляется как цифра рядом не с той подписью.
Перед тем как копировать результат
Если ваш PDF — это скан, более резкий оригинал, напечатанный, а не рукописный, контрастный, а не выцветший, даёт OCR больше материала для работы и оборачивается меньшим числом ошибок в скопированном тексте, поскольку здесь нет запасного форматирования, которое могло бы сгладить плохое распознавание.
Для длинного PDF используйте отметки страниц в возвращённом тексте, чтобы перейти сразу к нужному разделу, а не читать весь блок сверху донизу; это обычно быстрее, чем пролистывать копию каждой страницы, когда важна только одна.