Wyodrębnij tekst z PDF do skopiowania
Wgraj zeskanowany PDF, zdjęcie lub obraz. OCR odczytuje tekst z pikseli i przekształca go w edytowalne znaki. Działa z drukowanym tekstem w wielu językach. Radzi sobie z niskiej jakości skanami, przekrzywionymi stronami i różnorodnymi czcionkami.
Strony zachowują pierwotną kolejność ze znacznikiem między nimi, więc nawet duży, wielostronicowy PDF wraca jako jeden ciągły blok tekstu, który można przejrzeć i skopiować potrzebny fragment. Miejsce wklejenia wyniku wpływa też na podziały wierszy: zwykłe pole tekstowe zachowuje każdy oryginalny wiersz osobno, a niektóre miejsca z tekstem sformatowanym łączą krótkie wiersze w jeden akapit — sprawdź więc miejsce docelowe, jeśli strona z kilkoma kolumnami tuż po wklejeniu wygląda na zlepioną.
Dlaczego to pomija OCR, kiedy to możliwe
Zeskanowane dokumenty to tylko obrazy. Nie da się ich przeszukiwać, kopiować z nich tekstu ani ich edytować. OCR zamienia obrazy w prawdziwy tekst. Sprawia, że stare papierowe archiwa stają się przeszukiwalne. Pozwala wyodrębniać dane z zeskanowanych formularzy. Konwertuje drukowane materiały na edytowalne pliki.
Niezbędne do digitalizacji umów, paragonów, dokumentów historycznych i stron książek. Czytniki ekranu potrzebują prawdziwego tekstu, aby czytać na głos — OCR sprawia, że zeskanowane dokumenty stają się dostępne. Oszczędza godziny w porównaniu z ręcznym przepisywaniem.
Ocena PDF-a źródłowego
PDF, w którym już teraz można zaznaczyć tekst w zwykłej przeglądarce, wróci niemal dosłownie, ponieważ jest to bezpośrednia ekstrakcja bez żadnego zgadywania przy rozpoznawaniu; jakość zależy tam wyłącznie od kodowania oryginalnego pliku, które zwykle jest bardzo dobre.
PDF, w którym zaznaczanie tekstu tylko rysuje ramkę wokół strony, bez niczego faktycznie zaznaczalnego, jest skanem, a skopiowany wynik dla takich stron zależy od OCR odczytującego obraz; sprawdź taką stronę względem źródłowego PDF-a, jeśli linia wygląda podejrzanie, zanim jej zaufasz w pełni. Liczby w tabeli trafiają w sensownej kolejności, gdy pochodzą z PDF-a, który już przechowuje tekst, ponieważ pozycja każdego znaku jest zapisana w samym pliku, ale ta sama tabela pobrana z zeskanowanej strony zależy od tego, czy OCR poprawnie oceni granice kolumn, a błędnie oceniona granica objawia się jako cyfra stojąca obok niewłaściwej etykiety.
Zanim skopiujesz wynik
Jeśli Twój PDF jest skanem, ostrzejszy oryginał — drukowany, a nie odręczny, o wysokim kontraście, a nie wyblakły — daje OCR więcej materiału do pracy i przekłada się na mniej błędów w kopiowanym tekście, ponieważ nie ma tu żadnego mechanizmu formatowania, który złagodziłby słabe rozpoznawanie.
Przy długim PDF-ie korzystaj ze znaczników stron w zwróconym tekście, aby przejść od razu do potrzebnej sekcji, zamiast czytać cały blok od góry do dołu; zwykle jest to szybsze niż przewijanie kopii każdej strony, gdy liczy się tylko jedna.