Estrarre il testo di un PDF da copiare
L'OCR (Riconoscimento Ottico dei Caratteri) analizza le immagini di testo e le converte in caratteri reali e modificabili. Quando carichi un documento scansionato o una fotografia, il motore OCR esamina i pattern di pixel per identificare lettere, numeri e simboli. L'OCR moderno usa algoritmi avanzati per riconoscere il testo anche in condizioni difficili: bassa risoluzione, pagine inclinate, font variati e layout complessi con colonne, tabelle e contenuto misto.
Le pagine restano nel loro ordine originale con un indicatore tra l'una e l'altra, così anche un PDF di molte pagine torna come un unico blocco di testo continuo da scorrere per copiare la parte che ti serve davvero. Anche il punto in cui incolli il risultato cambia la resa degli a capo: un campo di testo semplice mantiene separate le righe originali, mentre alcune destinazioni in rich text uniscono le righe brevi in un solo paragrafo; controlla quindi la destinazione se una pagina a più colonne sembra compressa subito dopo averla incollata.
Perché questo salta l'OCR quando possibile
I documenti scansionati e i PDF basati su immagini contengono solo immagini di testo—non puoi cercare, copiare o modificarli. L'OCR trasforma queste immagini in testo reale, rendendo i documenti ricercabili, modificabili e accessibili. Quando devi trovare contenuto specifico in migliaia di pagine scansionate, l'OCR lo rende possibile. Archivi digitali, sistemi di gestione documenti e flussi di lavoro di conformità dipendono dall'OCR per rendere utile il contenuto scansionato.
Oltre alla ricercabilità, l'OCR permette l'estrazione di dati da documenti cartacei: digitalizzare contratti per l'analisi, estrarre dati da moduli, convertire materiali stampati in testo modificabile per il riutilizzo. I requisiti di accessibilità spesso richiedono testo ricercabile per utenti ipovedenti che usano screen reader. L'OCR colma il divario tra archivi cartacei e flussi di lavoro digitali.
Valutare il PDF sorgente
Un PDF in cui puoi già evidenziare il testo in un normale visualizzatore tornerà quasi testuale, poiché si tratta di un'estrazione diretta senza alcuna congettura di riconoscimento coinvolta; la qualità in quel caso è tanto buona quanto la codifica del file originale, che di solito è molto buona.
Un PDF in cui selezionare il testo disegna solo un riquadro attorno alla pagina, senza nulla di effettivamente selezionabile, è una scansione, e il risultato copiato per quelle pagine dipende dall'OCR che legge un'immagine; controlla una pagina del genere rispetto al PDF sorgente se una riga sembra sbagliata prima di fidartene completamente. I numeri di una tabella finiscono in un ordine utilizzabile quando provengono da un PDF che memorizza già testo, perché la posizione di ogni carattere è registrata nel file stesso, ma la stessa tabella estratta da una pagina scansionata dipende dal fatto che l'OCR giudichi correttamente i confini delle colonne, e un confine giudicato male appare come una cifra posta accanto all'etichetta sbagliata.
Prima di copiare il risultato
Se il tuo PDF è una scansione, un originale più nitido, stampato invece che scritto a mano, ad alto contrasto invece che sbiadito, offre all'OCR più materiale su cui lavorare e si traduce in meno errori nel testo che copi, poiché qui non c'è alcun ripiego di formattazione ad attenuare un riconoscimento andato male.
Per un PDF lungo, usa i marcatori di pagina nel testo restituito per saltare alla sezione di cui hai bisogno invece di leggere l'intero blocco dall'inizio alla fine; di solito è più veloce che scorrere una copia di ogni pagina quando conta solo una.