Plusieurs JPEG vers TXT (OCR)

Extraire le texte de plusieurs images JPEG avec OCR. Combiner le texte de séquences photo dans un fichier TXT téléchargeable.

Choisissez la langue du texte pour que le bon alphabet soit reconnu. Le mode automatique reconnaît de lui-même l'alphabet de chaque page.

JPG

ou glissez-déposez le fichier ici

Téléversez votre image JPEG

Conversion rapideTraitement sécuriséSans inscription

Des photos condensées en un seul fichier TXT

Mettez les photos JPEG dans un ZIP. L'OCR les lit dans l'ordre des noms et ajoute les mots reconnus à un seul fichier texte, avec un séparateur à chaque limite de page. Tout ce qui tient à l'aspect de la photo — éclairage, couleur du papier, écriture — disparaît ; restent les mots transcrits dans l'ordre de lecture.

C'est cette mise à plat qui rend un dossier de photos d'appareil exploitable par tout ce qui attend du texte en entrée, d'une formule de tableur à une recherche en ligne de commande, dont aucun ne sait lire un JPEG. Une ligne de marqueur fixe découpe le fichier en sections par photo, et aller à la page six revient à chercher la sixième occurrence de ce marqueur plutôt qu'à compter les paragraphes à l'œil, ce qui tient toujours sur un lot de plus de cinquante pages photographiées.

OCR de documents multi-pages

Traitez des ensembles de documents entiers avec nos outils d'OCR multipages. Mettez les images des pages dans un seul ZIP, nommées dans l'ordre, et obtenez un résultat unique : un PDF consultable, un document Word ou du texte avec toutes les pages. Idéal pour numériser livres, rapports, correspondance et archives.

Pour les grands documents, le traitement par lots fait gagner un temps significatif par rapport à la conversion page par page. Nos outils maintiennent l'ordre des pages, gèrent la qualité d'image variable entre les pages et produisent une sortie consolidée prête pour révision et utilisation. La mise en page originale de chaque page est préservée dans la sortie.

La précision d'un lot de photos

La qualité des photos pèse plus sur cette conversion que l'étape d'OCR elle-même : un reflet sur une page plastifiée, une prise tremblée à main levée ou un éclairage inégal font perdre des mots ou brouillent des caractères, et contrairement à un document mis en forme, il ne reste ensuite aucune mise en page visuelle pour vous aider à repérer où la reconnaissance a échoué.

Comparez rapidement le texte brut à la photo dont vous vous souvenez qu'elle était floue ou mal éclairée avant de faire confiance au lot ; un mot manquant en texte brut passe facilement inaperçu à une lecture rapide, puisqu'aucune mise en forme cassée ne signale qu'un problème est survenu sur cette page. Une facture ou un tableau photographié avec des lignes de colonnes visibles ressort tout de même comme une seule suite de mots dans le fichier .txt, les valeurs étant placées dans l'ordre de gauche à droite suivi par l'OCR sur la photo, si bien qu'un total situé sous son propre en-tête de colonne sur le papier peut se retrouver juste à côté d'un mot sans rapport une fois les colonnes disparues.

Photographier en vue d'un export en texte brut

Un éclairage homogène et diffus sur tout le lot compte plus ici que pour une conversion vers un document mis en forme, puisqu'aucune passe de mise en forme ultérieure ne vient masquer une page imparfaite ; les mots transcrits constituent la totalité du résultat, donc tout ce que l'OCR lit mal apparaît directement dans le fichier final. Le fichier est enregistré en UTF-8 avec des sauts de ligne de style Unix, ce qui gère correctement les caractères accentués et la plupart des symboles pour un script ou un import dans un tableur ; si le texte importé paraît encore corrompu, vérifiez que l'étape d'import elle-même lit bien de l'UTF-8 plutôt que de revenir à un autre encodage par défaut.

Nommez les fichiers dans l'ordre des pages (01, 02, 03…) avant de les zipper : les pages suivent les noms de fichiers et il n'y a pas d'étape de réorganisation ensuite.