PNGs gebündelt in einer TXT-Datei
Die PNGs in Ihrem ZIP werden in Dateinamen-Reihenfolge gelesen, und die erkannten Wörter jedes Bildes landen in einer einzigen UTF-8-.txt-Datei, mit einer Trennlinie, wo ein Bild endet und das nächste beginnt. Formatierung, Schriften und Layout entfallen; übrig bleiben die Wörter.
Das ist ein bewusster Kompromiss: Eine .txt-Datei hat keine Formatierung, die erhalten bleiben könnte, daher lohnt sich diese Wahl statt eines Word-Dokuments nur, wenn Sie tatsächlich den reinen Text aus einem Stapel Screenshots brauchen und kein Dokument, das noch wie die Originale aussieht. Jeder Trenner wiederholt zwischen den Seiten dieselbe kurze Textzeile – öffnen Sie die Datei in einem beliebigen Editor und suchen Sie genau diese Zeile, springen Sie direkt zum Anfang des gewünschten Quellbilds, statt den ganzen Stapel mit dem Auge durchzuscrollen.
Mehrseitige Dokument-OCR
Verarbeiten Sie ganze Dokumentensätze mit unseren mehrseitigen OCR-Werkzeugen. Legen Sie die Seitenbilder in ein ZIP, in Seitenreihenfolge benannt, und erhalten Sie ein gemeinsames Ergebnis – ein durchsuchbares PDF, ein Word-Dokument oder Text mit allen Seiten. Ideal zum Digitalisieren von Büchern, Berichten, Korrespondenz und Archivunterlagen.
Bei großen Dokumenten spart Stapelverarbeitung erhebliche Zeit im Vergleich zur Seite-für-Seite-Konvertierung. Unsere Tools bewahren die Seitenreihenfolge, verarbeiten variierende Bildqualität über Seiten hinweg und erzeugen konsolidierte Ausgabe, die zur Überprüfung und Verwendung bereit ist. Das ursprüngliche Layout jeder Seite wird in der Ausgabe bewahrt.
Was eine reine Textdatei verliert
Da PNG verlustfrei ist, erhält die OCR-Engine ein sauberes Bild als Grundlage, sodass die Worterkennungsgenauigkeit bei dieser Eingabe in der Regel genauso gut ausfällt wie bei jedem anderen PNG-basierten Tool; der Unterschied liegt hier ganz auf der Ausgabeseite, wo Überschriften, Tabellen und Zeilenumbrüche innerhalb eines Absatzes nicht als Struktur erhalten bleiben.
Enthalten Ihre Ausgangs-PNGs eine Tabelle, reiht die .txt-Ausgabe die Zellen in Lesereihenfolge aneinander, statt sie spaltenweise ausgerichtet zu belassen; das ist bei einem reinen Textexport zu erwarten und kein Erkennungsfehler, weshalb Sie eine tabellenlastige Seite vor dem Parsen manuell prüfen sollten. Eine wiederkehrende Kopf- oder Fußzeile auf jedem Ausgangs-PNG, etwa eine Seitenzahl oder ein Firmenname, taucht in der .txt-Datei einmal pro Seite auf, statt zusammengeführt zu werden, sodass ein vierzigseitiger Stapel dieselbe kurze Zeile vierzigmal verstreut mitten im Text enthalten kann.
Eine saubere Textausgabe erzielen
Benennen Sie die Dateien vor dem Zippen in Seitenreihenfolge (01, 02, 03…): Die Seiten folgen den Dateinamen, und einen Schritt zum Umsortieren gibt es danach nicht. Die Ausgabe nutzt Unix-Zeilenumbrüche, die moderne Editoren und Skriptsprachen direkt lesen; ein altes Windows-Tool, das CR/LF-Paare erwartet, braucht eventuell vorher eine kurze Umwandlung.
Achten Sie auf die Kodierung, wenn Ihre PNGs nicht-lateinische Zeichen oder Symbole enthalten; UTF-8 deckt die meisten Fälle ab, doch ein nachgelagertes Tool mit einer anderen eingestellten Kodierung kann Zeichen falsch lesen, die die OCR korrekt erkannt hat.