Как изображение таблицы превращается в электронную таблицу
Картинка читается с помощью OCR, который возвращает каждое распознанное слово вместе с рамкой, в которой оно находится. Строки складываются из слов на одной линии, столбцы — из вертикальных промежутков, проходящих через всю таблицу.
Линии разметки отбрасываются, а не читаются как символы, поэтому таблица с рамками не приходит забитой случайными вертикальными чертами. Вы скачиваете настоящую сетку: одна ячейка на одно значение.
От чего зависит точность чтения
Скриншот, снятый на компьютере, или планшетный скан при 300 DPI читаются почти идеально. Символы резкие, линии прямые, а столбцы разделены настоящими промежутками.
Фотография экрана или страницы сложнее: перспектива изгибает строки, блики съедают символы, а тень телефона попадает в столбец. Выровняйте и обрежьте фотографию перед загрузкой или переснимите её ровно.
Когда нужен именно этот инструмент
Таблица, пришедшая скриншотом в чат, страница отчёта, существующая только как изображение, или отсканированная форма, числа из которой нужны вам в электронной таблице.
Если числа лежат в PDF с текстовым слоем, лучше подойдёт наш инструмент PDF в Excel: он читает текст напрямую, а не распознаёт его по пикселям.
Ограничения, о которых стоит знать
Результат — плоская сетка. Объединённые ячейки записываются в первую из тех, которые они занимают, а цвета, шрифты и формулы не восстанавливаются, потому что в картинке их нет.
Текст читается в латинице, что покрывает английский и другие западноевропейские языки. Таблица из связного текста вместо значений или изображение без таблицы отклоняются с сообщением, а не превращаются в файл с мусором.
Похожие инструменты
- PDF в Excel — для PDF, в котором текст выделяется
- PDF в CSV — то же извлечение, вывод обычным текстом
- AI PDF в Excel — выберите таблицу вручную и поправьте сетку перед экспортом