PDF do TXT (OCR)

Wyodrębniaj tekst z zeskanowanych dokumentów PDF do zwykłych plików TXT za pomocą OCR. Rozpoznawaj tekst w plikach PDF opartych na obrazach i pobieraj do dalszego przetwarzania.

Wybierz język tekstu, aby rozpoznawany był właściwy alfabet. Tryb automatyczny sam rozpoznaje alfabet na każdej stronie.

PDF

lub przeciągnij i upuść plik tutaj

Prześlij swój plik PDF

Szybka konwersjaBezpieczne przetwarzanieBez rejestracji

Jeden PDF w plik TXT

Wgraj zeskanowany PDF, zdjęcie lub obraz. OCR odczytuje tekst z pikseli i przekształca go w edytowalne znaki. Działa z drukowanym tekstem w wielu językach. Radzi sobie z niskiej jakości skanami, przekrzywionymi stronami i różnorodnymi czcionkami.

Tak czy inaczej otrzymujesz jeden plik .txt ze stronami dołączonymi po kolei i separatorem oznaczającym każdy podział strony, gotowy do zapisania, przeszukania lub przekazania do skryptu; w gotowym pliku nie widać różnicy między tekstem wyodrębnionym a rozpoznanym przez OCR.

Dlaczego najpierw sprawdzić warstwę tekstową

Zeskanowane dokumenty to tylko obrazy. Nie da się ich przeszukiwać, kopiować z nich tekstu ani ich edytować. OCR zamienia obrazy w prawdziwy tekst. Sprawia, że stare papierowe archiwa stają się przeszukiwalne. Pozwala wyodrębniać dane z zeskanowanych formularzy. Konwertuje drukowane materiały na edytowalne pliki.

Niezbędne do digitalizacji umów, paragonów, dokumentów historycznych i stron książek. Czytniki ekranu potrzebują prawdziwego tekstu, aby czytać na głos — OCR sprawia, że zeskanowane dokumenty stają się dostępne. Oszczędza godziny w porównaniu z ręcznym przepisywaniem.

Jak rozpoznać, co masz

Jeśli w zwykłej przeglądarce możesz już zaznaczyć i skopiować tekst z PDF-a, oznacza to, że ma on warstwę tekstową, a wynik .txt będzie ściśle odpowiadał temu osadzonemu tekstowi, ponieważ nie ma tu żadnego zgadywania przez OCR; dokładność w tym przypadku zależy wyłącznie od sposobu, w jaki PDF został pierwotnie utworzony.

Jeśli kliknięcie w celu zaznaczenia tekstu tylko podświetla prostokąt wokół całej strony, albo nic się nie dzieje, strona jest zeskanowanym obrazem, a treść .txt dla niej zależy od jakości OCR; sprawdź rozdzielczość skanu i ostrość oryginalnego dokumentu, jeśli zeskanowana strona wypada gorzej niż oczekiwano. Tabela wewnątrz PDF-a, który już zawiera warstwę tekstową, zwykle zachowuje wartości komórek w sensownej kolejności czytania, ponieważ pozycja każdego znaku jest zapisana bezpośrednio w pliku, podczas gdy ta sama tabela na zeskanowanej stronie zależy od tego, czy OCR poprawnie przejdzie przez kolumny, więc zeskanowana faktura częściej wymaga później ręcznego wyrównania niż tabela pobrana wprost z natywnego PDF-a.

Jak uzyskać wiarygodny wynik TXT

W przypadku zeskanowanego PDF-a skan w wyższej rozdzielczości na wejściu daje czystszy tekst na wyjściu, a rozsądnym celem, jeśli sam wykonujesz skanowanie, jest 300 DPI lub więcej, ponieważ wszystko poniżej zaczyna obniżać dokładność OCR na drobniejszym druku.

W przypadku PDF-a łączącego strony natywne i zeskanowane sprawdź wynik .txt w okolicy granicy między nimi, ponieważ to jedyne miejsce, w którym zmienia się obsługa na poziomie strony i gdzie nietypowy nagłówek lub stopka czasem myli kolejność stron w znacznikach separatora. Plik jest zapisywany jako UTF-8 z podziałami linii w stylu uniksowym w całości, niezależnie od tego, czy dana strona pochodziła z bezpośredniej ekstrakcji, czy z OCR, więc skrypt czytający wynik nie musi osobno obsługiwać obu rodzajów stron źródłowych, gdy tekst został już zapisany.