Fotos zu einer TXT-Datei zusammengefasst
Legen Sie die JPEG-Fotos in ein ZIP. OCR liest sie in Dateinamen-Reihenfolge und hängt die erkannten Wörter an eine einzige Textdatei an, mit einem Trenner an jeder Seitengrenze. Wie das Foto aussah – Licht, Papierfarbe, Handschrift – verschwindet; übrig bleiben die Wörter in Lesereihenfolge.
Erst dieser Schritt des Einebnens macht einen Ordner voller Kamerafotos für alles nutzbar, was Text als Eingabe erwartet – von einer Tabellenformel bis zur Suche auf der Kommandozeile –, denn nichts davon kann überhaupt ein JPEG lesen. Eine feste Markierungszeile teilt die Datei in Abschnitte pro Foto, und um zu Seite sechs zu springen, sucht man nach dem sechsten Vorkommen dieser Markierung, statt Absätze mit dem Auge zu zählen – das funktioniert auch noch bei einem Stapel von mehr als fünfzig fotografierten Seiten.
Mehrseitige Dokument-OCR
Verarbeiten Sie ganze Dokumentensätze mit unseren mehrseitigen OCR-Werkzeugen. Legen Sie die Seitenbilder in ein ZIP, in Seitenreihenfolge benannt, und erhalten Sie ein gemeinsames Ergebnis – ein durchsuchbares PDF, ein Word-Dokument oder Text mit allen Seiten. Ideal zum Digitalisieren von Büchern, Berichten, Korrespondenz und Archivunterlagen.
Bei großen Dokumenten spart Stapelverarbeitung erhebliche Zeit im Vergleich zur Seite-für-Seite-Konvertierung. Unsere Tools bewahren die Seitenreihenfolge, verarbeiten variierende Bildqualität über Seiten hinweg und erzeugen konsolidierte Ausgabe, die zur Überprüfung und Verwendung bereit ist. Das ursprüngliche Layout jeder Seite wird in der Ausgabe bewahrt.
Genauigkeit bei einem Kamera-Stapel
Die Fotoqualität bestimmt diese Umwandlung stärker als der Erkennungsschritt selbst: Blendlicht auf einer laminierten Seite, eine zittrige Freihandaufnahme oder ungleichmäßiges Licht lassen Wörter ausfallen oder Zeichen verstümmeln, und anders als bei einem formatierten Dokument bleibt danach kein visuelles Layout übrig, das Ihnen zeigt, wo die Erkennung danebenlag.
Überfliegen Sie den Rohtext im Vergleich zu einem Foto, das Ihnen als unscharf oder schlecht beleuchtet in Erinnerung ist, bevor Sie dem Stapel vertrauen; ein fehlendes Wort in reinem Text übersieht man bei einem schnellen Lesen leicht, da keine kaputte Formatierung darauf hinweist, dass auf dieser Seite etwas schiefgelaufen ist. Eine fotografierte Rechnung oder Tabelle mit sichtbaren Spaltenlinien kommt in der .txt-Datei trotzdem als ein durchgehender Wortfluss heraus, mit Werten in der Reihenfolge, in der die Texterkennung das Foto von links nach rechts abgetastet hat, sodass eine Summe, die auf dem Papier unter ihrer eigenen Spaltenüberschrift stand, ohne die Spalten direkt neben einem unzusammenhängenden Wort landen kann.
Aufnehmen für reinen Text-Export
Gleichmäßiges, diffuses Licht im gesamten Stapel ist hier wichtiger als bei einer Umwandlung in ein formatiertes Dokument, da es keinen späteren Formatierungsschritt gibt, der eine schwierige Seite kaschiert; die transkribierten Wörter sind die gesamte Ausgabe, sodass sich jeder Lesefehler der Texterkennung direkt in der fertigen Datei zeigt. Die Datei wird als UTF-8 mit Unix-Zeilenumbrüchen gespeichert, was Akzentzeichen und die meisten Symbole für ein Skript oder einen Tabellenimport korrekt abdeckt; wirkt importierter Text weiterhin verstümmelt, prüfen Sie, ob der Importschritt selbst UTF-8 liest, statt auf eine andere Standardkodierung zurückzufallen.
Benennen Sie die Dateien vor dem Zippen in Seitenreihenfolge (01, 02, 03…): Die Seiten folgen den Dateinamen, und einen Schritt zum Umsortieren gibt es danach nicht.