Visualiseur de structure de document PDF

Visualisez la structure d'un PDF dans votre navigateur : titres, paragraphes, listes et images encadrés sur chaque page dans l'ordre de lecture, signets et balises. Export JSON ou Markdown.

PDF

ou glissez-déposez le fichier ici

PDF

Conversion rapideTraitement sécuriséSans inscription

Ce que montre le visualiseur de structure

Envoyez un PDF : chaque page est dessinée avec des cadres colorés autour de chaque bloc trouvé par l'outil, titres sur trois niveaux, paragraphes, éléments de liste et images. Chaque cadre porte un numéro, et la liste à côté de la page reprend les blocs dans cet ordre, pour montrer la séquence qu'un convertisseur ou un lecteur d'écran suivrait.

Cliquez sur un cadre ou une entrée de la liste pour le mettre en évidence aux deux endroits, et activez ou désactivez les types de blocs pour vous concentrer sur un seul genre d'élément. Les signets et, pour les PDF balisés, les balises de structure de la première page sont également listés. Si l'objectif est une copie modifiable plutôt qu'une carte, PDF en Word se charge de la conversion.

Comment les blocs sont détectés

ÉlémentComment il est reconnu
TitresBlocs courts composés nettement plus grands que le corps du texte. La plus grande taille devient Titre 1, la suivante Titre 2, puis Titre 3. Une seule ligne en gras à la taille du corps est traitée comme titre mineur.
ParagraphesDes lignes de même taille, proches et qui se chevauchent horizontalement, sont réunies en un bloc ; un écart plus grand ou un changement de taille commence le suivant.
Éléments de listeUne ligne qui commence par une puce, un tiret, un chiffre ou une lettre suivis d'un point ou d'une parenthèse devient un élément de liste à part entière.
ImagesChaque image matricielle dessinée sur la page, mesurée d'après les instructions de dessin, de sorte que le cadre correspond à l'image placée et non au fichier qu'elle contient.
Ordre de lectureLes blocs sont séparés au plus large espace vide, gouttières verticales avant écarts horizontaux, si bien que deux colonnes sous un titre pleine largeur sont lues colonne par colonne.

Comment visualiser la structure d'un PDF

  1. Sélectionnez un PDF. Les vingt premières pages sont rendues et analysées dans votre navigateur.
  2. Parcourez les pages. La légende indique combien de blocs de chaque type ont été trouvés ; cliquez sur un type pour le masquer ou l'afficher.
  3. Cliquez sur un cadre pour voir son texte, sa taille de police et sa position dans la liste de droite.
  4. Téléchargez le résultat en JSON avec les cadres, ou en plan Markdown qui conserve titres, éléments de liste et emplacements d'images.

Quand la carte est utile

Avant de convertir un rapport, vérifiez que ses titres sont de vrais titres et que les colonnes seront lues dans le bon ordre ; si la carte paraît fausse, le document converti le sera aussi. Pour les documents numérisés, la carte reste vide faute de couche texte, et OCR PDF en Word est l'outil à utiliser.

Le plan Markdown est un moyen rapide de transformer un PDF en notes ou en table des matières. Quand c'est tout le texte qui compte et non son squelette, PDF en Markdown transfère aussi le corps.

À quoi s'attendre

La détection repose sur la géométrie et les tailles de police, pas sur l'intention de l'auteur. Une grande citation en exergue est étiquetée titre, un paragraphe à retrait négatif peut se scinder en deux, et les tableaux apparaissent comme plusieurs paragraphes ou éléments de liste plutôt que comme une grille. Les dessins vectoriels tels que les graphiques ne sont pas encadrés ; seules les images matricielles le sont.

Les PDF protégés par mot de passe ne s'ouvrent pas ici ; utilisez d'abord Déverrouiller PDF. Les balises de structure sont lues dans le fichier quand elles existent, mais les cadres sont calculés d'après la page, si bien qu'un document non balisé obtient tout de même une carte complète. Pour vérifier formellement le balisage et la conformité d'archivage, lancez le validateur PDF/A.

Questions fréquentes

L'analyse se fait-elle dans mon navigateur ?

Oui. Les pages sont rendues et les blocs détectés sur votre appareil, et les téléchargements JSON et Markdown sont générés localement. La politique de confidentialité décrit le traitement général des envois et des données d'utilisation.

Pourquoi un paragraphe est-il étiqueté comme titre ?

Les titres sont reconnus à la taille : un bloc court composé nettement plus grand que le corps compte comme titre. Une citation en exergue, une ligne de couverture ou une grande lettrine passent le même test. L'étiquette décrit la composition de la page, pas l'intention de l'auteur.

Que signifie le numéro d'ordre de lecture ?

C'est la séquence dans laquelle les blocs seraient lus si la page était linéarisée : de haut en bas, et colonne par colonne là où la page en a. C'est l'ordre qu'un convertisseur ou un lecteur d'écran suivra probablement, d'où le fait qu'un ordre erroné sur la carte annonce généralement un ordre erroné dans le fichier converti.

Pourquoi mon PDF numérisé n'affiche-t-il aucun bloc ?

Un scan est une image de page, le seul bloc que l'outil peut trouver est donc l'image elle-même. Passez d'abord le fichier par l'OCR pour ajouter une couche texte ; les titres et paragraphes deviendront alors visibles.

Les tableaux sont-ils détectés ?

Pas en tant que tableaux. Les cellules ressortent comme de petits paragraphes ou éléments de liste placés à l'emplacement des cellules, ce qui montre tout de même l'ordre de lecture qu'un convertisseur adoptera. Pour extraire des tableaux, utilisez PDF en Excel.

Que contient l'export JSON ?

Une entrée par page analysée avec sa taille en points et chaque bloc dans l'ordre de lecture : type, texte, taille de police, indicateur de gras et cadre mesuré depuis le coin supérieur gauche. L'export Markdown ne garde que les titres, éléments de liste, paragraphes et emplacements d'images.