JPEG в TXT (OCR)

Извлечение текста из JPEG-фотографий с помощью OCR. Конвертация сфотографированных документов, чеков и досок в текстовые файлы.

Укажите язык текста, чтобы распознавание шло в нужном алфавите. Автоматический режим сам определяет алфавит на каждой странице.

JPG

или перетащите файл сюда

Загрузите ваше изображение JPEG

Быстрая конвертацияБезопасная обработкаБез регистрации

Превращаем фото JPEG в файл TXT

OCR (оптическое распознавание символов) анализирует изображения текста и преобразует их в фактические редактируемые символы. Когда вы загружаете отсканированный документ или фотографию, движок OCR исследует шаблоны пикселей для идентификации букв, цифр и символов. Современный OCR использует продвинутые алгоритмы для распознавания текста даже в сложных условиях: низкое разрешение, перекошенные страницы, различные шрифты и сложные макеты с колонками, таблицами и смешанным содержимым.

На фотографии больше визуального шума, чем на цифровом скриншоте, — тени, небольшой наклон, фактура бумаги, — поэтому распознаванию приходится сначала справиться с этим, а уже потом создавать текстовый файл. Сам результат при этом — простой набор строк и слов, без попытки воспроизвести колонки, отступы или интервалы исходной сфотографированной страницы.

Зачем превращать фото в текстовые файлы

Отсканированные документы и PDF на основе изображений содержат только картинки текста — вы не можете искать, копировать или редактировать их. OCR преобразует эти изображения в реальный текст, делая документы поисковыми, редактируемыми и доступными. Когда вам нужно найти конкретное содержимое среди тысяч отсканированных страниц, OCR делает это возможным. Цифровые архивы, системы управления документами и рабочие процессы комплаенса зависят от OCR для превращения отсканированного содержимого в полезное.

Помимо поиска, OCR позволяет извлекать данные из бумажных документов: оцифровывать контракты для анализа, извлекать данные из форм, конвертировать печатные материалы в редактируемый текст для повторного использования. Требования доступности часто требуют поискового текста для пользователей с нарушениями зрения, использующих программы чтения с экрана. OCR соединяет бумажные архивы и цифровые рабочие процессы.

Шум фото против чистого текста

На точность превращения фото в текст влияют и сжатие JPEG, и условия съёмки: мягкий фокус, смазанность от движения или JPEG, сохранённый с низким качеством, могут слить тонкие штрихи, разделяющие похожие буквы, что даёт больше неверно распознанных символов, чем дал бы аналогичный скан или скриншот. Поскольку файл .txt не сохраняет оформление, визуально отметить неверно распознанное слово, когда это случилось, уже нечем.

Ровный свет, съёмка прямо сверху и резкий фокус дают самую большую разницу для результата в .txt — больше, чем количество мегапикселей камеры. Резкое фото со среднего камерофона, снятое достаточно близко, чтобы текст заполнял кадр, как правило, превзойдёт широкий, дальний снимок с более дорогой камеры, где текст занимает лишь малую часть изображения.

Как фотографировать для чистого TXT

Подойдите достаточно близко, чтобы текст заполнял большую часть кадра, поскольку дальний снимок заставляет распознавание работать с меньшим числом пикселей на букву, чем близкий, плотно обрезанный. Снимайте строго сверху вниз на страницу, а не под углом, и используйте естественный дневной свет или ровное освещение комнаты вместо одной лампы, из-за которой одна сторона страницы темнее другой.

Держите камеру неподвижно или упритесь ею во что-нибудь твёрдое, поскольку даже небольшое смазывание от движения смягчает края настолько, что путает похожие буквы вроде m и rn или l и 1. Для документа из нескольких страниц делайте по одному снимку на страницу, а не пытайтесь уместить всю стопку в один широкий кадр, и конвертируйте каждую отдельно ради более чистого текстового файла.