Фото, сведённые в единый TXT
Сложите фото JPEG в один ZIP. OCR читает их в порядке имён файлов и добавляет распознанные слова в один текстовый файл с разделителем на границе каждой страницы. Всё, как выглядело фото, — освещение, цвет бумаги, почерк — исчезает; остаются расшифрованные слова в порядке чтения.
Именно такое «уплощение» делает папку с фотографиями с камеры пригодной для всего, что принимает на вход текст, — от формулы в таблице до поиска в командной строке, ведь ничто из этого не умеет читать JPEG. Фиксированная строка-разделитель делит файл на части по фотографиям, и чтобы перейти к шестой странице, достаточно найти шестое вхождение разделителя, а не считать абзацы на глаз, — это работает даже в пачке из более чем пятидесяти сфотографированных страниц.
Многостраничное распознавание документов OCR
Обрабатывайте целые наборы документов нашими многостраничными OCR-инструментами. Сложите изображения страниц в один ZIP, назвав их по порядку, и получите единый результат — PDF с поиском, документ Word или текст со всеми страницами. Это идеально для оцифровки книг, отчётов, переписки и архивных записей.
Для больших документов пакетная обработка экономит значительное время по сравнению с постраничной конвертацией. Наши инструменты сохраняют порядок страниц, обрабатывают различное качество изображений на разных страницах и производят консолидированный результат, готовый к просмотру и использованию. Оригинальный макет каждой страницы сохраняется в выходном файле.
Точность по партии с камеры
Качество фото определяет эту конвертацию сильнее, чем сам этап OCR: блики на заламинированной странице, смазанный снимок с рук или неровный свет приведут к пропущенным словам или искажённым символам, и, в отличие от отформатированного документа, никакой визуальной вёрстки потом не остаётся, чтобы помочь заметить, где распознавание ошиблось.
Прежде чем доверять партии, пробегитесь по сырому тексту рядом с фото, которое, как вы помните, было размытым или плохо освещённым; пропущенное слово в обычном тексте легко упустить при беглом чтении, поскольку никакое сломанное форматирование не сигнализирует, что на этой странице что-то пошло не так. Сфотографированный счёт или таблица с видимыми линиями столбцов всё равно превращается в файле .txt в один сплошной поток слов, со значениями в том порядке слева направо, в каком OCR прошёл по фото, поэтому итог, стоявший на бумаге под собственным заголовком столбца, после исчезновения столбцов может оказаться прямо рядом с не связанным с ним словом.
Как снимать для чистого текстового результата
Ровное, рассеянное освещение по всей партии важнее здесь, чем при конвертации в отформатированный документ, поскольку потом нет этапа форматирования, который бы замаскировал неудачную страницу; расшифрованные слова — это весь результат целиком, поэтому всё, что OCR прочитает неверно, попадёт прямо в итоговый файл. Файл сохраняется в UTF-8 с переносами строк в стиле Unix, что корректно покрывает символы с диакритикой и большинство знаков для скрипта или импорта в таблицу; если импортированный текст всё же выглядит искажённым, проверьте, что сам этап импорта читает именно UTF-8, а не откатывается к другой кодировке по умолчанию.
Перед упаковкой в ZIP назовите файлы по порядку страниц (01, 02, 03…): страницы идут по именам файлов, и переставить их потом нельзя.