PNG compressi in un unico TXT
I PNG del tuo ZIP vengono letti in ordine di nome file e le parole riconosciute di ogni immagine vengono aggiunte a un unico .txt UTF-8, con una riga divisoria dove finisce un'immagine e inizia la successiva. Formattazione, font e layout vengono scartati; restano le parole.
È un compromesso voluto: un file .txt non ha stili da conservare, quindi sceglierlo al posto di un documento Word ha senso solo quando ti serve davvero il testo grezzo di un lotto di screenshot, non un documento che somigli ancora agli originali. Ogni separatore ripete la stessa breve riga di testo tra le pagine, quindi aprendo il file in qualsiasi editor e cercando proprio quella riga salti subito all'inizio dell'immagine sorgente che ti interessa, invece di scorrere tutto il lotto a occhio.
OCR di Documenti Multi-Pagina
Elabora interi insiemi di documenti con i nostri strumenti OCR multipagina. Metti le immagini delle pagine in un unico ZIP, con nomi in ordine di pagina, e ottieni un risultato unico: un PDF ricercabile, un documento Word o testo con tutte le pagine. Ideale per digitalizzare libri, report, corrispondenza e archivi.
Per documenti grandi, l'elaborazione batch risparmia tempo significativo rispetto alla conversione pagina per pagina. I nostri strumenti mantengono l'ordine delle pagine, gestiscono qualità delle immagini variabile tra le pagine e producono output consolidato pronto per revisione e uso. Il layout originale di ogni pagina è preservato nell'output.
Cosa perde un file semplice
Poiché il PNG è senza perdita di qualità, il motore OCR riceve un'immagine pulita da leggere, quindi l'accuratezza a livello di parola su questo input tende a essere buona quanto su qualsiasi altro strumento basato su PNG; la differenza qui è interamente sul lato dell'output, dove titoli, tabelle e interruzioni di riga all'interno di un paragrafo non vengono preservati come struttura.
Se i tuoi PNG sorgente includono una tabella, aspettati che l'output .txt unisca le celle nell'ordine di lettura invece di mantenerle allineate in colonne; questo è un comportamento previsto per un'esportazione in testo semplice, non un errore di riconoscimento, ed è il motivo principale per controllare manualmente una pagina ricca di tabelle prima di fidarsi del file per l'analisi. Un'intestazione o un piè di pagina ripetuti su ogni PNG sorgente, come un numero di pagina o un nome aziendale, compaiono una volta per pagina nel file .txt invece di essere uniti, quindi un lotto di quaranta pagine può finire con quella stessa breve riga sparsa quaranta volte nel mezzo del tuo testo.
Ottenere un output di testo pulito
Dai ai file nomi in ordine di pagina (01, 02, 03…) prima di comprimerli in ZIP: le pagine seguono i nomi e poi non c'è un passaggio per riordinarle. L'uscita usa a capo in stile Unix, che editor e linguaggi di scripting moderni leggono direttamente; un vecchio strumento Windows che si aspetta coppie CR/LF potrebbe richiedere prima una rapida conversione.
Tieni d'occhio la codifica se i tuoi PNG contengono caratteri o simboli non latini; l'UTF-8 copre la stragrande maggioranza dei casi, ma uno strumento a valle impostato su una codifica diversa può comunque leggere male caratteri che l'OCR ha riconosciuto correttamente.