Wyodrębnij tekst z PDF (OCR)

Wyodrębniaj i od razu przeglądaj tekst z zeskanowanych dokumentów PDF za pomocą OCR. Kopiuj tekst do schowka lub pobierz jako plik TXT. Bez instalowania oprogramowania.

Wybierz język tekstu, aby rozpoznawany był właściwy alfabet. Tryb automatyczny sam rozpoznaje alfabet na każdej stronie.

PDF

lub przeciągnij i upuść plik tutaj

Prześlij swój plik PDF

Szybka konwersjaBezpieczne przetwarzanieBez rejestracji

Wyodrębnij tekst z PDF do skopiowania

Wgraj zeskanowany PDF, zdjęcie lub obraz. OCR odczytuje tekst z pikseli i przekształca go w edytowalne znaki. Działa z drukowanym tekstem w wielu językach. Radzi sobie z niskiej jakości skanami, przekrzywionymi stronami i różnorodnymi czcionkami.

Strony zachowują pierwotną kolejność ze znacznikiem między nimi, więc nawet duży, wielostronicowy PDF wraca jako jeden ciągły blok tekstu, który można przejrzeć i skopiować potrzebny fragment. Miejsce wklejenia wyniku wpływa też na podziały wierszy: zwykłe pole tekstowe zachowuje każdy oryginalny wiersz osobno, a niektóre miejsca z tekstem sformatowanym łączą krótkie wiersze w jeden akapit — sprawdź więc miejsce docelowe, jeśli strona z kilkoma kolumnami tuż po wklejeniu wygląda na zlepioną.

Dlaczego to pomija OCR, kiedy to możliwe

Zeskanowane dokumenty to tylko obrazy. Nie da się ich przeszukiwać, kopiować z nich tekstu ani ich edytować. OCR zamienia obrazy w prawdziwy tekst. Sprawia, że stare papierowe archiwa stają się przeszukiwalne. Pozwala wyodrębniać dane z zeskanowanych formularzy. Konwertuje drukowane materiały na edytowalne pliki.

Niezbędne do digitalizacji umów, paragonów, dokumentów historycznych i stron książek. Czytniki ekranu potrzebują prawdziwego tekstu, aby czytać na głos — OCR sprawia, że zeskanowane dokumenty stają się dostępne. Oszczędza godziny w porównaniu z ręcznym przepisywaniem.

Ocena PDF-a źródłowego

PDF, w którym już teraz można zaznaczyć tekst w zwykłej przeglądarce, wróci niemal dosłownie, ponieważ jest to bezpośrednia ekstrakcja bez żadnego zgadywania przy rozpoznawaniu; jakość zależy tam wyłącznie od kodowania oryginalnego pliku, które zwykle jest bardzo dobre.

PDF, w którym zaznaczanie tekstu tylko rysuje ramkę wokół strony, bez niczego faktycznie zaznaczalnego, jest skanem, a skopiowany wynik dla takich stron zależy od OCR odczytującego obraz; sprawdź taką stronę względem źródłowego PDF-a, jeśli linia wygląda podejrzanie, zanim jej zaufasz w pełni. Liczby w tabeli trafiają w sensownej kolejności, gdy pochodzą z PDF-a, który już przechowuje tekst, ponieważ pozycja każdego znaku jest zapisana w samym pliku, ale ta sama tabela pobrana z zeskanowanej strony zależy od tego, czy OCR poprawnie oceni granice kolumn, a błędnie oceniona granica objawia się jako cyfra stojąca obok niewłaściwej etykiety.

Zanim skopiujesz wynik

Jeśli Twój PDF jest skanem, ostrzejszy oryginał — drukowany, a nie odręczny, o wysokim kontraście, a nie wyblakły — daje OCR więcej materiału do pracy i przekłada się na mniej błędów w kopiowanym tekście, ponieważ nie ma tu żadnego mechanizmu formatowania, który złagodziłby słabe rozpoznawanie.

Przy długim PDF-ie korzystaj ze znaczników stron w zwróconym tekście, aby przejść od razu do potrzebnej sekcji, zamiast czytać cały blok od góry do dołu; zwykle jest to szybsze niż przewijanie kopii każdej strony, gdy liczy się tylko jedna.