OCR Online - Bild zu Text

Text aus Bildern und gescannten Dokumenten per OCR extrahieren. JPG, PNG und PDF werden in durchsuchbare, bearbeitbare Formate mit präziser Texterkennung umgewandelt.

Optische Zeichenerkennung

OCR (Optische Zeichenerkennung) wandelt Textbilder in tatsächlichen, bearbeitbaren Text um. Gescannte Dokumente, Seitenfotos und bildbasierte PDFs werden nach der OCR-Verarbeitung durchsuchbar und bearbeitbar. Unsere Tools erkennen Text in mehreren Sprachen, bewahren das Dokumentlayout und geben in Ihrem gewünschten Format aus: durchsuchbare PDF, die identisch zum Original aussieht, aber mit auswählbarem Text, oder bearbeitbare Word-Dokumente für vollständige Inhaltsänderung. Perfekt zum Digitalisieren von Papierarchiven, Extrahieren von Daten aus Scans oder zum Zugänglichmachen von Dokumenten.

Wie OCR-Technologie funktioniert

Texterkennung (OCR) analysiert Bilder, um Text zu finden. Die Engine erkennt Textbereiche, Zeilen, Wörter und einzelne Zeichen und vergleicht jede Form mit bekannten Mustern, um zu bestimmen, welcher Buchstabe, welche Ziffer oder welches Symbol es ist. Sie liest das Bild so, wie Sie es hochladen – ohne automatisches Begradigen oder Kontrastkorrektur –, daher liefert ein gerader, gleichmäßig beleuchteter Scan das beste Ergebnis.

Moderne OCR verwendet maschinelle Lernmodelle, die auf Millionen von Dokumentenproben trainiert wurden. Diese Modelle erkennen Zeichen in verschiedenen Schriftarten, Größen und Stilen mit hoher Genauigkeit. Sie können degradierten Text von Fotokopien, verblassten Dokumenten und niedrigauflösenden Scans verarbeiten, mit denen ältere OCR-Systeme Schwierigkeiten hätten.

Dokumentqualität für OCR optimieren

Scan-Qualität wirkt sich direkt auf OCR-Genauigkeit aus. Streben Sie 300 DPI (Punkte pro Zoll) oder höher an—dies bietet genügend Detail für zuverlässige Zeichenerkennung. Reinigen Sie das Scannerglas vor dem Scannen, um Flecken und Streifen zu vermeiden. Legen Sie Dokumente flach und gerade hin, um Schrägstellung zu minimieren, die Textzeilenerkennung verwirren kann.

Für fotografierte Dokumente sorgen Sie für gleichmäßige Beleuchtung ohne Schatten über dem Text. Halten Sie die Kamera parallel zur Dokumentoberfläche, um Perspektivverzerrung zu vermeiden. Schneiden Sie eng an den Dokumentkanten zu und speichern Sie im PNG-Format (verlustfrei) statt JPEG (das Komprimierungsartefakte um Text hinzufügt).

Wahl zwischen durchsuchbarem PDF und bearbeitbarem DOCX

Durchsuchbares PDF-Ausgabe bewahrt das ursprüngliche Dokumenterscheinungsbild exakt bei gleichzeitiger Hinzufügung einer unsichtbaren Textebene. Dies ermöglicht Suche im Dokument, Auswahl und Kopieren von Text, bewahrt aber die visuelle Treue des Originalscans. Ideal für Archivierung historischer Dokumente, rechtlicher Aufzeichnungen oder jedes Dokuments, bei dem visuelle Authentizität wichtig ist.

DOCX-Ausgabe erstellt ein vollständig bearbeitbares Dokument, in dem Text, Formatierung und Layout geändert werden können. Die OCR-Engine versucht, Absatzstruktur, Schriften und grundlegende Formatierung nachzubilden. Verwenden Sie DOCX, wenn Sie Inhalte überarbeiten, Abschnitte zur Wiederverwendung extrahieren oder gescannten Text in andere Dokumente integrieren müssen.

Mehrseitige Dokument-OCR

Verarbeiten Sie ganze Dokumentensätze mit unseren mehrseitigen OCR-Werkzeugen. Legen Sie die Seitenbilder in ein ZIP, in Seitenreihenfolge benannt, und erhalten Sie ein gemeinsames Ergebnis – ein durchsuchbares PDF, ein Word-Dokument oder Text mit allen Seiten. Ideal zum Digitalisieren von Büchern, Berichten, Korrespondenz und Archivunterlagen.

Bei großen Dokumenten spart Stapelverarbeitung erhebliche Zeit im Vergleich zur Seite-für-Seite-Konvertierung. Unsere Tools bewahren die Seitenreihenfolge, verarbeiten variierende Bildqualität über Seiten hinweg und erzeugen konsolidierte Ausgabe, die zur Überprüfung und Verwendung bereit ist. Das ursprüngliche Layout jeder Seite wird in der Ausgabe bewahrt.

Sprachunterstützung für OCR

Die gewählte Sprache entscheidet, welches Erkennungsmodell die Datei liest, und jedes Modell kennt nur eine Buchstabenfamilie. Eine russische Seite, die als Englisch gelesen wird, kommt als Unsinn zurück; diese Auswahl wiegt also schwerer als jede andere Einstellung auf dieser Seite. Die Einstellung Automatisch nimmt Ihnen diese Wahl ab: Sie erkennt auf jeder Seite die Schrift (lateinisch, kyrillisch, griechisch, arabisch, Devanagari, Thai, Koreanisch, Chinesisch oder Japanisch) und nimmt das passende Modell; nur traditionelles Chinesisch wählen Sie besser von Hand.

Ein Dokument, dessen Seiten in verschiedenen Sprachen geschrieben sind, müssen Sie mit Automatisch nicht aufteilen: Jede Seite wird mit ihrem eigenen Modell gelesen. Innerhalb einer Seite wird eine Zeile in einem anderen Alphabet mit dem Modell dieser Seite gelesen; wählen Sie für eine solche Seite deren Hauptsprache oder setzen Sie den anderssprachigen Teil auf eine eigene Seite. Für beste Ergebnisse mit spezialisiertem Inhalt (medizinisch, juristisch, technisch) erwarten Sie gelegentliche Fehler bei domänenspezifischer Terminologie.

Häufige OCR-Anwendungen

Geschäftsanwender digitalisieren Verträge, Rechnungen, Belege und Korrespondenz für durchsuchbare Archive. Rechtsteams konvertieren Falldateien und Entdeckungsdokumente für Volltextsuche. Gesundheitsorganisationen digitalisieren Patientenakten und medizinische Formulare. Bildungseinrichtungen archivieren historische Dokumente, Forschungsmaterialien und seltene Publikationen.

Regierungsbehörden machen öffentliche Aufzeichnungen durchsuchbar und zugänglich. Forscher extrahieren Text aus historischen Zeitungen, Manuskripten und gedruckten Archiven. Buchhalter digitalisieren Finanzunterlagen zur Analyse. Jeder Workflow mit Papierdokumenten profitiert von OCR-Digitalisierung.

OCR vs. Direkte PDF-Konvertierung: Was brauchen Sie?

Nicht alle PDF-zu-Word-Konvertierungen erfordern OCR. Wenn Ihr PDF digital erstellt wurde — aus Word exportiert, von Software generiert oder aus digitalem Text erstellt — enthält es bereits extrahierbaren Text. Direkte Konvertierungstools wie unser PDF-zu-Word-Konverter extrahieren diese Textebene schnell und genau. OCR ist für diese Dokumente unnötig und würde tatsächlich die Qualität verringern.

OCR wird unerlässlich, wenn PDFs nur Bilder enthalten: gescannte Papierdokumente, fotografierte Seiten, Faxe oder PDFs, die aus Bilddateien erstellt wurden. Diese erscheinen visuell als Text, enthalten aber keine tatsächlichen Textdaten — nur Bilder von Text. Unsere OCR-Tools analysieren diese Bilder, erkennen Zeichen und erstellen echten, bearbeitbaren Text. Wenn Sie Text in Ihrem PDF nicht auswählen können, benötigen Sie OCR.

Für umfassende Anleitungen zum Umgang mit gescannten Dokumenten lesen Sie unseren detaillierten Leitfaden zur Konvertierung gescannter PDFs in bearbeitbare Word-Dokumente mit OCR. Er behandelt Vorbereitungstipps, Qualitätsoptimierung und Fehlerbehebung bei häufigen Problemen. Learn more about OCR for scanned PDFs

Tipps für beste OCR-Ergebnisse

Vorbereitung beeinflusst die OCR-Genauigkeit erheblich. Verwenden Sie beim Scannen mindestens 300 DPI Auflösung mit schwarzem Text auf weißem Hintergrund. Reinigen Sie das Scannerglas, richten Sie Seiten gerade aus und vermeiden Sie Schatten oder Falten. Achten Sie bei Fotos auf gleichmäßige Beleuchtung, halten Sie die Kamera parallel zum Dokument und verwenden Sie die höchste Auflösungseinstellung.

Wählen Sie vor der Verarbeitung die richtige Dokumentsprache — dies aktiviert sprachspezifische Wörterbücher und Zeichenmuster. Lesen Sie die Ausgabe nach der Konvertierung immer Korrektur, besonders bei Zahlen, Eigennamen und Fachbegriffen. OCR kann ähnliche Zeichen wie 0/O, 1/l/I und rn/m verwechseln. Verwenden Sie die Rechtschreibprüfung als Ausgangspunkt, aber überprüfen Sie kritische Daten manuell.

Häufige Fragen

Was ist OCR und wie funktioniert es?

OCR (Optische Zeichenerkennung) ist eine Technologie, die Bilder von Text in maschinenlesbaren Text konvertiert. Sie analysiert Formen und Muster in gescannten Dokumenten oder Fotos, erkennt Zeichen und gibt bearbeitbaren Text aus, den Sie durchsuchen, kopieren und bearbeiten können.

Welche Dateiformate kann ich mit OCR konvertieren?

Unsere OCR-Tools unterstützen JPG, PNG und PDF Dateien. Sie können diese in durchsuchbares PDF (behält das ursprüngliche Aussehen bei gleichzeitiger Textauswahl) oder bearbeitbares DOCX-Format zur weiteren Bearbeitung in Textverarbeitungsprogrammen konvertieren.

Wie genau ist die OCR-Texterkennung?

Die OCR-Genauigkeit hängt von der Bildqualität und der Lesbarkeit des Textes ab. In unserem Test mit 10 Seiten echter gescannter russischer Dokumente lag die Zeichenfehlerrate bei 5,6 % für einen Vertrag und bei 7,6 % für einen Kontoauszug mit Tabellen – etwa 92–94 von 100 Zeichen waren richtig. Die Genauigkeit verbessern: gerade ausgerichteter Text, hoher Kontrast, klare Schriften und die Wahl der richtigen Sprache.

Kann ich Dokumente in mehreren Sprachen mit OCR verarbeiten?

Ja. Es stehen 29 Dokumentsprachen zur Auswahl: lateinische Schrift, Kyrillisch, Griechisch, Arabisch, Persisch, Devanagari, Chinesisch, Japanisch, Koreanisch und Thai. Wählen Sie die Sprache, in der Ihr Dokument geschrieben ist, oder lassen Sie Automatisch eingestellt: Das Modell wird Seite für Seite gewählt, sodass eine Datei mit Seiten in verschiedenen Sprachen ohne Aufteilen gelesen wird. Mischt eine einzelne Seite zwei Alphabete, wählen Sie die Sprache, die auf dieser Seite überwiegt.

Was ist der Unterschied zwischen durchsuchbarem PDF und DOCX-Ausgabe?

Durchsuchbares PDF bewahrt Ihr ursprüngliches Dokumenterscheinungsbild bei gleichzeitiger Hinzufügung einer unsichtbaren Textebene für Suche und Kopieren. DOCX erstellt ein vollständig bearbeitbares Dokument, in dem Sie Text, Formatierung und Layout ändern können. Wählen Sie durchsuchbares PDF zur Archivierung, DOCX zur Bearbeitung.

Kann OCR Text aus handschriftlichen Notizen extrahieren?

OCR funktioniert am besten mit gedrucktem oder getipptem Text. Handschrifterkennung (ICR) ist deutlich schwieriger, und unsere OCR-Engine ist nicht dafür ausgelegt – rechnen Sie selbst bei sauberer Handschrift mit vielen Fehlern und bei Schreibschrift oder unordentlichen Notizen mit weit mehr. Bei handschriftlichen Dokumenten schwanken die Ergebnisse stark je nach Lesbarkeit, Gleichmäßigkeit und Schreibstil. Gedruckter Text liefert deutlich bessere Ergebnisse.