Visualizzatore della struttura di un PDF

Visualizza la struttura di un PDF nel browser: titoli, paragrafi, elenchi e immagini evidenziati su ogni pagina in ordine di lettura, più segnalibri e tag. Export JSON o Markdown.

PDF

o trascina e rilascia il file qui

PDF

Conversione rapidaElaborazione sicuraNessuna registrazione

Cosa mostra il visualizzatore della struttura

Carica un PDF e ogni pagina viene disegnata con riquadri colorati intorno a ogni blocco trovato: titoli su tre livelli, paragrafi, voci di elenco e immagini. Ogni riquadro porta un numero e l'elenco accanto alla pagina ripete i blocchi in quell'ordine, così vedi la sequenza che seguirebbe un convertitore o uno screen reader.

Fai clic su un riquadro o su una voce dell'elenco per evidenziarli in entrambi i punti, e attiva o disattiva i tipi di blocco per concentrarti su un solo genere di elemento. Vengono elencati anche i segnalibri e, per i PDF con tag, i tag di struttura della prima pagina. Se l'obiettivo è una copia modificabile e non una mappa, la conversione la fa PDF in Word.

Come vengono rilevati i blocchi

ElementoCome viene riconosciuto
TitoliBlocchi brevi composti in un corpo nettamente maggiore del testo. La dimensione più grande diventa Titolo 1, la successiva Titolo 2, poi Titolo 3. Una singola riga in grassetto nel corpo del testo è trattata come titolo minore.
ParagrafiRighe della stessa dimensione, vicine e sovrapposte in orizzontale, vengono unite in un blocco; uno spazio maggiore o un cambio di dimensione avvia il successivo.
Voci di elencoUna riga che inizia con un punto elenco, un trattino, un numero o una lettera seguiti da punto o parentesi diventa una voce di elenco a sé.
ImmaginiOgni immagine raster disegnata nella pagina, misurata dalle istruzioni di disegno, così il riquadro corrisponde all'immagine collocata e non al file al suo interno.
Ordine di letturaI blocchi vengono separati sul vuoto più largo, prima le colonne verticali e poi gli spazi orizzontali, così due colonne sotto un titolo a tutta larghezza si leggono colonna per colonna.

Come visualizzare la struttura di un PDF

  1. Seleziona un PDF. Le prime venti pagine vengono renderizzate e analizzate nel browser.
  2. Scorri le pagine. La legenda mostra quanti blocchi di ogni tipo sono stati trovati; fai clic su un tipo per nasconderlo o mostrarlo.
  3. Fai clic su un riquadro per vederne testo, dimensione del carattere e posizione nell'elenco a destra.
  4. Scarica il risultato come JSON con i riquadri, oppure come struttura Markdown che conserva titoli, voci di elenco e segnaposto delle immagini.

Quando la mappa è utile

Prima di convertire un report, verifica che i suoi titoli siano veri titoli e che le colonne vengano lette nell'ordine giusto; se la mappa sembra sbagliata, lo sarà anche il documento convertito. Per i documenti scansionati la mappa resta vuota, perché non c'è un livello di testo da leggere, e lo strumento adatto è OCR PDF in Word.

La struttura Markdown è un modo rapido per trasformare un PDF in appunti o in un indice. Quando conta l'intero testo e non solo il suo scheletro, PDF in Markdown porta con sé anche il corpo.

Cosa aspettarsi

Il rilevamento si basa su geometria e dimensioni dei caratteri, non sull'intenzione dell'autore. Una grande citazione in evidenza viene etichettata come titolo, un paragrafo con rientro sporgente può dividersi in due, e le tabelle appaiono come più paragrafi o voci di elenco invece che come griglia. I disegni vettoriali, come i grafici, non vengono riquadrati; solo le immagini raster.

I PDF protetti da password non si aprono qui; usa prima Sblocca PDF. I tag di struttura vengono letti dal file quando ci sono, ma i riquadri sono calcolati dalla pagina, quindi anche un documento senza tag ottiene una mappa completa. Per verificare formalmente tag e conformità archivistica, esegui il validatore PDF/A.

Domande frequenti

L'analisi avviene nel mio browser?

Sì. Le pagine vengono renderizzate e i blocchi rilevati sul tuo dispositivo, e i download JSON e Markdown sono generati in locale. L'informativa sulla privacy descrive il trattamento generale dei caricamenti e dei dati d'uso.

Perché un paragrafo è etichettato come titolo?

I titoli si riconoscono dalla dimensione: un blocco breve composto in un corpo nettamente maggiore del testo conta come titolo. Una citazione in evidenza, una riga di copertina o un grande capolettera superano la stessa prova. L'etichetta descrive come è composta la pagina, non cosa intendeva l'autore.

Cosa significa il numero dell'ordine di lettura?

È la sequenza in cui i blocchi verrebbero letti se la pagina fosse linearizzata: dall'alto in basso e colonna per colonna dove la pagina ha colonne. È l'ordine che un convertitore o uno screen reader seguirà probabilmente, per questo un ordine errato nella mappa di solito anticipa un ordine errato nel file convertito.

Perché il mio PDF scansionato non mostra blocchi?

Una scansione è l'immagine di una pagina, quindi l'unico blocco che lo strumento può trovare è l'immagine stessa. Passa prima il file dall'OCR per aggiungere un livello di testo: titoli e paragrafi diventeranno visibili.

Le tabelle vengono rilevate?

Non come tabelle. Le celle compaiono come piccoli paragrafi o voci di elenco posizionati dove stanno le celle, il che mostra comunque l'ordine di lettura che un convertitore seguirà. Per estrarre le tabelle usa PDF in Excel.

Cosa contiene l'esportazione JSON?

Una voce per ogni pagina analizzata con la sua dimensione in punti e ogni blocco in ordine di lettura: tipo, testo, dimensione del carattere, indicatore di grassetto e riquadro misurato dall'angolo superiore sinistro. L'esportazione Markdown conserva solo titoli, voci di elenco, paragrafi e segnaposto delle immagini.