Jak działa konwersja PDF na CSV
Konwerter szuka w PDF tabel, ustala z położenia tekstu i linii siatki, gdzie są wiersze i kolumny, i zapisuje komórki w pliku CSV.
Kiedy PDF zawiera kilka tabel, każda jest zapisywana po kolei z wierszem nagłówka, który podaje jej stronę, więc możesz podzielić plik albo usunąć niepotrzebne części.
Dlaczego CSV, a nie Excel
CSV to zwykły tekst, czyli dokładnie to, czego chce skrypt, import do bazy danych albo narzędzie analityczne. Nic nie musi rozbierać formatu arkusza, żeby go przeczytać.
Otwiera się też w Excel, Google Sheets, Numbers i LibreOffice Calc. Wybierz nasze narzędzie PDF na Excel, jeśli chcesz formatowanie, scalone komórki i jeden arkusz na tabelę.
Typowe zastosowania
Przeniesienie wyciągu bankowego, cennika albo tabeli z raportu do arkusza bez przepisywania wierszy ręcznie.
Wczytanie liczb z opublikowanego PDF do skryptu albo bazy danych, gdzie CSV jest najkrótszą drogą od dokumentu do twojego zapytania.
Czego oczekiwać od wyniku
Plik jest w UTF-8 ze znacznikiem kolejności bajtów, więc znaki diakrytyczne i tekst niełaciński otwierają się poprawnie w Excel po dwukliku. Wartości z przecinkiem albo cudzysłowem są cytowane tak, jak wymaga standard CSV.
CSV nie ma miejsca na scalone komórki, kolory ani wiele arkuszy, więc scalony nagłówek zostaje zapisany w pierwszej ze swoich komórek. PDF bez warstwy tekstowej nie zawiera tabeli, którą narzędzie mogłoby znaleźć, i najpierw potrzebuje OCR.
Wskazówki na czystsze tabele
Tabele z liniami siatki konwertują się najdokładniej, bo linie mówią narzędziu dokładnie, gdzie kończy się każda kolumna.
Otwórz CSV i porównaj pierwszy i ostatni wiersz z PDF. Brakujący ostatni wiersz zwykle znaczy, że tabela ciągnęła się na stronę, którą ekstraktor potraktował osobno.