Un PDF in un file TXT
L'OCR (Riconoscimento Ottico dei Caratteri) analizza le immagini di testo e le converte in caratteri reali e modificabili. Quando carichi un documento scansionato o una fotografia, il motore OCR esamina i pattern di pixel per identificare lettere, numeri e simboli. L'OCR moderno usa algoritmi avanzati per riconoscere il testo anche in condizioni difficili: bassa risoluzione, pagine inclinate, font variati e layout complessi con colonne, tabelle e contenuto misto.
In entrambi i casi ottieni un unico file .txt con le pagine accodate in ordine e un separatore che segna ogni interruzione di pagina, pronto da salvare, cercare o passare a uno script; nel file finale non si nota alcuna differenza tra testo estratto e testo riconosciuto con OCR.
Perché controllare prima la presenza di un livello di testo
I documenti scansionati e i PDF basati su immagini contengono solo immagini di testo—non puoi cercare, copiare o modificarli. L'OCR trasforma queste immagini in testo reale, rendendo i documenti ricercabili, modificabili e accessibili. Quando devi trovare contenuto specifico in migliaia di pagine scansionate, l'OCR lo rende possibile. Archivi digitali, sistemi di gestione documenti e flussi di lavoro di conformità dipendono dall'OCR per rendere utile il contenuto scansionato.
Oltre alla ricercabilità, l'OCR permette l'estrazione di dati da documenti cartacei: digitalizzare contratti per l'analisi, estrarre dati da moduli, convertire materiali stampati in testo modificabile per il riutilizzo. I requisiti di accessibilità spesso richiedono testo ricercabile per utenti ipovedenti che usano screen reader. L'OCR colma il divario tra archivi cartacei e flussi di lavoro digitali.
Come capire cosa hai
Se puoi già selezionare e copiare testo dal PDF in un normale lettore, ha un livello di testo e l'output .txt corrisponderà da vicino a quel testo incorporato, poiché non è coinvolta alcuna congettura dell'OCR; l'accuratezza in quel caso dipende solo da come è stato creato originariamente il PDF.
Se cliccando per selezionare il testo si evidenzia solo un rettangolo attorno all'intera pagina, o non succede nulla, la pagina è un'immagine scansionata e il contenuto .txt per essa dipende dalla qualità dell'OCR; controlla la risoluzione della scansione e la nitidezza del documento originale se una pagina scansionata si legge peggio del previsto. Una tabella all'interno di un PDF che porta già un livello di testo di solito mantiene i valori delle celle in un ordine di lettura sensato, poiché la posizione di ogni carattere è memorizzata direttamente nel file, mentre la stessa tabella su una pagina scansionata dipende dal fatto che l'OCR percorra correttamente le colonne, quindi una fattura scansionata ha più probabilità di richiedere un riallineamento manuale in seguito rispetto a una estratta direttamente da un PDF nativo.
Ottenere un output TXT affidabile
Per un PDF scansionato, una scansione a risoluzione più alta in ingresso produce un testo più pulito in uscita, con 300 DPI o superiore come obiettivo ragionevole se sei tu a effettuare la scansione, poiché qualsiasi valore inferiore inizia a costare accuratezza all'OCR sui caratteri più piccoli.
Per un PDF che mescola pagine native e scansionate, controlla l'output .txt attorno al confine tra le due, poiché è l'unico punto in cui cambia la gestione a livello di pagina e dove un'intestazione o un piè di pagina insolito a volte confonde l'ordine delle pagine nei marcatori separatori. Il file viene scritto come UTF-8 con interruzioni di riga in stile Unix in tutto il documento, indipendentemente dal fatto che una data pagina provenga da estrazione diretta o da OCR, così uno script che legge il risultato non ha bisogno di una gestione separata per i due tipi di pagina sorgente una volta che il testo è stato scritto.