Извлечь текст из PDF (OCR)

Извлечение и просмотр текста из сканированных PDF с помощью OCR. Копирование текста в буфер обмена или скачивание в формате TXT.

Укажите язык текста, чтобы распознавание шло в нужном алфавите. Автоматический режим сам определяет алфавит на каждой странице.

PDF

или перетащите файл сюда

Загрузите ваш PDF файл

Быстрая конвертацияБезопасная обработкаБез регистрации

Извлекаем текст PDF для копирования

OCR (оптическое распознавание символов) анализирует изображения текста и преобразует их в фактические редактируемые символы. Когда вы загружаете отсканированный документ или фотографию, движок OCR исследует шаблоны пикселей для идентификации букв, цифр и символов. Современный OCR использует продвинутые алгоритмы для распознавания текста даже в сложных условиях: низкое разрешение, перекошенные страницы, различные шрифты и сложные макеты с колонками, таблицами и смешанным содержимым.

Страницы сохраняют исходный порядок и разделены меткой, поэтому даже большой многостраничный PDF возвращается одним сплошным блоком текста, который можно просмотреть и скопировать нужную часть. То, куда вы вставляете результат, влияет и на переносы строк: обычное текстовое поле сохраняет каждую исходную строку отдельно, а некоторые редакторы с форматированием склеивают короткие строки в один абзац, поэтому проверьте место вставки, если многоколоночная страница сразу после вставки выглядит слипшейся.

Почему это пропускает OCR, когда можно

Отсканированные документы и PDF на основе изображений содержат только картинки текста — вы не можете искать, копировать или редактировать их. OCR преобразует эти изображения в реальный текст, делая документы поисковыми, редактируемыми и доступными. Когда вам нужно найти конкретное содержимое среди тысяч отсканированных страниц, OCR делает это возможным. Цифровые архивы, системы управления документами и рабочие процессы комплаенса зависят от OCR для превращения отсканированного содержимого в полезное.

Помимо поиска, OCR позволяет извлекать данные из бумажных документов: оцифровывать контракты для анализа, извлекать данные из форм, конвертировать печатные материалы в редактируемый текст для повторного использования. Требования доступности часто требуют поискового текста для пользователей с нарушениями зрения, использующих программы чтения с экрана. OCR соединяет бумажные архивы и цифровые рабочие процессы.

Оцениваем исходный PDF

PDF, в котором текст уже можно выделить в обычной программе просмотра, вернётся почти дословно, поскольку это прямое извлечение без каких-либо догадок распознавания; качество здесь ограничено только тем, насколько хорошо изначально закодирован файл, а это обычно очень хорошо.

PDF, в котором попытка выделить текст просто рисует рамку вокруг страницы, а выделить по-настоящему ничего нельзя, — это скан, и скопированный результат для таких страниц зависит от того, как OCR прочитает картинку; сверьте такую страницу с исходным PDF, если строка выглядит подозрительно, прежде чем полностью ей доверять. Числа в таблице попадают в удобный порядок, если они взяты из PDF, который уже хранит текст, поскольку позиция каждого символа записана прямо в файле, но та же таблица, снятая со сканированной страницы, зависит от того, правильно ли OCR определит границы столбцов, и ошибочно определённая граница проявляется как цифра рядом не с той подписью.

Перед тем как копировать результат

Если ваш PDF — это скан, более резкий оригинал, напечатанный, а не рукописный, контрастный, а не выцветший, даёт OCR больше материала для работы и оборачивается меньшим числом ошибок в скопированном тексте, поскольку здесь нет запасного форматирования, которое могло бы сгладить плохое распознавание.

Для длинного PDF используйте отметки страниц в возвращённом тексте, чтобы перейти сразу к нужному разделу, а не читать весь блок сверху донизу; это обычно быстрее, чем пролистывать копию каждой страницы, когда важна только одна.