Jak obraz tabeli staje się arkuszem kalkulacyjnym
Obraz jest czytany przez OCR, który zwraca każde rozpoznane słowo wraz z ramką, w której się znajduje. Wiersze powstają ze słów leżących w jednej linii, a kolumny z pionowych przerw biegnących przez całą tabelę.
Linie siatki są odrzucane, a nie czytane jako znaki, więc tabela z obramowaniem nie przychodzi pełna przypadkowych kresek. To, co pobierasz, jest prawdziwą siatką: jedna komórka na jedną wartość.
Od czego zależy dokładność odczytu
Zrzut ekranu zrobiony na komputerze albo skan płaski w 300 DPI czyta się niemal bezbłędnie. Znaki są ostre, linie proste, a kolumny rozdzielone prawdziwymi przerwami.
Zdjęcie ekranu lub strony jest trudniejsze: perspektywa wygina wiersze, odblaski zjadają znaki, a cień telefonu wpada w kolumnę. Wyprostuj i przytnij zdjęcie przed wysłaniem albo zrób je ponownie na płasko.
Kiedy to jest właściwe narzędzie
Tabela, która przyszła jako zrzut ekranu na czacie, strona raportu istniejąca tylko jako obraz albo zeskanowany formularz, którego liczby potrzebujesz w arkuszu kalkulacyjnym.
Jeśli liczby są w PDF z warstwą tekstową, lepszą drogą jest nasze narzędzie PDF na Excel, bo czyta tekst bezpośrednio, a nie rozpoznaje go z pikseli.
Ograniczenia, o których warto wiedzieć
Wynikiem jest płaska siatka. Scalone komórki są zapisywane w pierwszej komórce, którą obejmują, a kolory, czcionki i formuły nie są odtwarzane, bo obraz ich nie zawiera.
Tekst jest czytany w alfabecie łacińskim, co obejmuje angielski i pozostałe języki Europy Zachodniej. Tabela z ciągłym tekstem zamiast wartości albo obraz bez żadnej tabeli zostaje odrzucony komunikatem, a nie plikiem pełnym szumu.
Powiązane narzędzia
- PDF na Excel — dla PDF, w którym tekst da się zaznaczyć
- PDF na CSV — ta sama ekstrakcja, wynik w zwykłym tekście
- AI PDF na Excel — wybierz tabelę ręcznie i popraw siatkę przed eksportem