Jeden PDF w plik TXT
Wgraj zeskanowany PDF, zdjęcie lub obraz. OCR odczytuje tekst z pikseli i przekształca go w edytowalne znaki. Działa z drukowanym tekstem w wielu językach. Radzi sobie z niskiej jakości skanami, przekrzywionymi stronami i różnorodnymi czcionkami.
Tak czy inaczej otrzymujesz jeden plik .txt ze stronami dołączonymi po kolei i separatorem oznaczającym każdy podział strony, gotowy do zapisania, przeszukania lub przekazania do skryptu; w gotowym pliku nie widać różnicy między tekstem wyodrębnionym a rozpoznanym przez OCR.
Dlaczego najpierw sprawdzić warstwę tekstową
Zeskanowane dokumenty to tylko obrazy. Nie da się ich przeszukiwać, kopiować z nich tekstu ani ich edytować. OCR zamienia obrazy w prawdziwy tekst. Sprawia, że stare papierowe archiwa stają się przeszukiwalne. Pozwala wyodrębniać dane z zeskanowanych formularzy. Konwertuje drukowane materiały na edytowalne pliki.
Niezbędne do digitalizacji umów, paragonów, dokumentów historycznych i stron książek. Czytniki ekranu potrzebują prawdziwego tekstu, aby czytać na głos — OCR sprawia, że zeskanowane dokumenty stają się dostępne. Oszczędza godziny w porównaniu z ręcznym przepisywaniem.
Jak rozpoznać, co masz
Jeśli w zwykłej przeglądarce możesz już zaznaczyć i skopiować tekst z PDF-a, oznacza to, że ma on warstwę tekstową, a wynik .txt będzie ściśle odpowiadał temu osadzonemu tekstowi, ponieważ nie ma tu żadnego zgadywania przez OCR; dokładność w tym przypadku zależy wyłącznie od sposobu, w jaki PDF został pierwotnie utworzony.
Jeśli kliknięcie w celu zaznaczenia tekstu tylko podświetla prostokąt wokół całej strony, albo nic się nie dzieje, strona jest zeskanowanym obrazem, a treść .txt dla niej zależy od jakości OCR; sprawdź rozdzielczość skanu i ostrość oryginalnego dokumentu, jeśli zeskanowana strona wypada gorzej niż oczekiwano. Tabela wewnątrz PDF-a, który już zawiera warstwę tekstową, zwykle zachowuje wartości komórek w sensownej kolejności czytania, ponieważ pozycja każdego znaku jest zapisana bezpośrednio w pliku, podczas gdy ta sama tabela na zeskanowanej stronie zależy od tego, czy OCR poprawnie przejdzie przez kolumny, więc zeskanowana faktura częściej wymaga później ręcznego wyrównania niż tabela pobrana wprost z natywnego PDF-a.
Jak uzyskać wiarygodny wynik TXT
W przypadku zeskanowanego PDF-a skan w wyższej rozdzielczości na wejściu daje czystszy tekst na wyjściu, a rozsądnym celem, jeśli sam wykonujesz skanowanie, jest 300 DPI lub więcej, ponieważ wszystko poniżej zaczyna obniżać dokładność OCR na drobniejszym druku.
W przypadku PDF-a łączącego strony natywne i zeskanowane sprawdź wynik .txt w okolicy granicy między nimi, ponieważ to jedyne miejsce, w którym zmienia się obsługa na poziomie strony i gdzie nietypowy nagłówek lub stopka czasem myli kolejność stron w znacznikach separatora. Plik jest zapisywany jako UTF-8 z podziałami linii w stylu uniksowym w całości, niezależnie od tego, czy dana strona pochodziła z bezpośredniej ekstrakcji, czy z OCR, więc skrypt czytający wynik nie musi osobno obsługiwać obu rodzajów stron źródłowych, gdy tekst został już zapisany.