Несколько PNG в TXT (OCR)

Извлечение текста из нескольких PNG-изображений с помощью OCR. Объединение текста из нескольких изображений в один TXT-файл.

Укажите язык текста, чтобы распознавание шло в нужном алфавите. Автоматический режим сам определяет алфавит на каждой странице.

PNG

или перетащите файл сюда

Загрузите ваше изображение PNG

Быстрая конвертацияБезопасная обработкаБез регистрации

PNG, уплотнённые в единый TXT-файл

PNG из вашего ZIP читаются в порядке имён файлов, а распознанные слова каждого изображения добавляются в один файл .txt в UTF-8 с разделительной строкой там, где кончается одно изображение и начинается следующее. Форматирование, шрифты и вёрстка отбрасываются; остаются только слова.

Это осознанный компромисс: в файле .txt нет оформления, которое нужно сохранять, поэтому выбирать его вместо документа Word имеет смысл, только когда вам действительно нужен сырой текст из пачки скриншотов, а не документ, похожий на оригиналы. Каждый разделитель повторяет между страницами одну и ту же короткую строку, поэтому, открыв файл в любом редакторе и найдя именно эту строку, вы сразу попадёте к началу нужного исходного изображения, а не будете пролистывать всю пачку на глаз.

Многостраничное распознавание документов OCR

Обрабатывайте целые наборы документов нашими многостраничными OCR-инструментами. Сложите изображения страниц в один ZIP, назвав их по порядку, и получите единый результат — PDF с поиском, документ Word или текст со всеми страницами. Это идеально для оцифровки книг, отчётов, переписки и архивных записей.

Для больших документов пакетная обработка экономит значительное время по сравнению с постраничной конвертацией. Наши инструменты сохраняют порядок страниц, обрабатывают различное качество изображений на разных страницах и производят консолидированный результат, готовый к просмотру и использованию. Оригинальный макет каждой страницы сохраняется в выходном файле.

Что теряет простой текстовый файл

Поскольку PNG — формат без потерь, механизм OCR получает для чтения чистое изображение, поэтому точность распознавания слов здесь не уступает любому другому инструменту на основе PNG; разница целиком на стороне результата — заголовки, таблицы и переносы строк внутри абзаца не сохраняются как структура.

Если среди исходных PNG есть таблица, в файле .txt её ячейки будут идти подряд в порядке чтения, а не оставаться выровненными по столбцам; это ожидаемое поведение при экспорте в обычный текст, а не ошибка распознавания, и именно поэтому страницу с таблицей стоит проверить вручную перед тем, как доверять файл парсингу. Повторяющаяся строка колонтитула на каждом исходном PNG, например номер страницы или название компании, попадает в .txt по разу на страницу, а не объединяется, — так что при сорока страницах одна и та же короткая строка может оказаться разбросанной сорок раз посреди текста.

Как получить чистый текстовый результат

Перед упаковкой в ZIP назовите файлы по порядку страниц (01, 02, 03…): страницы идут по именам файлов, и переставить их потом нельзя. В результате используются переводы строк в стиле Unix, которые современные редакторы и скриптовые языки читают сразу; старому инструменту Windows, ожидающему пары CR/LF, может понадобиться быстрое преобразование.

Следите за кодировкой, если ваши PNG содержат не латинские символы: UTF-8 покрывает подавляющее большинство случаев, но инструмент, настроенный на другую кодировку, может неверно прочитать символы, которые OCR распознал правильно.