Plusieurs PNG rassemblés en un seul TXT
Les PNG de votre ZIP sont lus dans l'ordre des noms de fichiers, et les mots reconnus de chaque image sont ajoutés à un seul fichier .txt en UTF-8, avec une ligne de séparation là où une image s'arrête et la suivante commence. Mise en forme, polices et mise en page disparaissent ; seuls les mots restent.
C'est un compromis délibéré : un fichier .txt n'a aucune mise en forme à préserver, donc le choisir plutôt qu'un document Word n'a de sens que si vous avez réellement besoin du texte brut d'un lot de captures d'écran, et non d'un document qui ressemble encore aux originaux. Chaque séparateur répète la même courte ligne de texte entre les pages : ouvrez le fichier dans n'importe quel éditeur et recherchez cette ligne exacte pour sauter directement au début de l'image source voulue, au lieu de faire défiler tout le lot à l'œil.
OCR de documents multi-pages
Traitez des ensembles de documents entiers avec nos outils d'OCR multipages. Mettez les images des pages dans un seul ZIP, nommées dans l'ordre, et obtenez un résultat unique : un PDF consultable, un document Word ou du texte avec toutes les pages. Idéal pour numériser livres, rapports, correspondance et archives.
Pour les grands documents, le traitement par lots fait gagner un temps significatif par rapport à la conversion page par page. Nos outils maintiennent l'ordre des pages, gèrent la qualité d'image variable entre les pages et produisent une sortie consolidée prête pour révision et utilisation. La mise en page originale de chaque page est préservée dans la sortie.
Ce qu'un fichier texte brut fait perdre
Le format PNG étant sans perte, le moteur OCR dispose d'une image propre à analyser, si bien que la précision au niveau des mots pour cette entrée est généralement aussi bonne que pour tout autre outil basé sur PNG ; la différence se situe entièrement du côté de la sortie, où les titres, les tableaux et les sauts de ligne à l'intérieur d'un paragraphe ne sont pas conservés en tant que structure.
Si vos PNG source contiennent un tableau, attendez-vous à ce que la sortie .txt enchaîne les cellules dans l'ordre de lecture plutôt que de les conserver alignées en colonnes ; c'est un comportement normal pour un export en texte brut, pas une erreur de reconnaissance, et c'est la principale raison de vérifier manuellement une page riche en tableaux avant de faire confiance au fichier pour un traitement automatisé. Une ligne d'en-tête ou de pied de page répétée sur chaque PNG source, comme un numéro de page ou un nom d'entreprise, apparaît une fois par page dans le fichier .txt plutôt que d'être fusionnée, si bien qu'un lot de quarante pages peut se retrouver avec cette même courte ligne dispersée quarante fois au milieu de votre texte.
Obtenir un résultat texte propre
Nommez les fichiers dans l'ordre des pages (01, 02, 03…) avant de les zipper : les pages suivent les noms de fichiers et il n'y a pas d'étape de réorganisation ensuite. La sortie utilise des fins de ligne Unix, que les éditeurs et langages de script modernes lisent directement ; un ancien outil Windows qui attend des paires CR/LF peut nécessiter une conversion rapide avant.
Surveillez l'encodage si vos PNG contiennent des caractères non latins ou des symboles ; l'UTF-8 couvre la grande majorité des cas, mais un outil en aval configuré avec un encodage différent peut tout de même mal interpréter des caractères que l'OCR a pourtant correctement reconnus.