Visualizador de estructura de documentos PDF

Visualice la estructura de un PDF en su navegador: títulos, párrafos, listas e imágenes marcados en cada página en orden de lectura, más marcadores y etiquetas. JSON o Markdown.

PDF

o arrastra y suelta el archivo aquí

PDF

Conversión rápidaProcesamiento seguroSin registro

Qué muestra el visualizador de estructura

Suba un PDF y cada página se dibuja con recuadros de colores alrededor de cada bloque que la herramienta encuentra: títulos de tres niveles, párrafos, elementos de lista e imágenes. Cada recuadro lleva un número, y la lista junto a la página repite los bloques en ese orden, para que vea la secuencia que seguiría un conversor o un lector de pantalla.

Haga clic en un recuadro o en una entrada de la lista para resaltarlo en ambos sitios, y active o desactive tipos de bloque para centrarse en un solo tipo de elemento. También se listan los marcadores y, en los PDF etiquetados, las etiquetas de estructura de la primera página. Si lo que busca es una copia editable y no un mapa, PDF a Word hace la conversión.

Cómo se detectan los bloques

ElementoCómo se reconoce
TítulosBloques cortos compuestos en un tamaño claramente mayor que el texto del cuerpo. El tamaño mayor pasa a ser Título 1, el siguiente Título 2 y luego Título 3. Una sola línea en negrita al tamaño del cuerpo se trata como título menor.
PárrafosLas líneas del mismo tamaño que están juntas y se solapan horizontalmente se unen en un bloque; un hueco mayor o un cambio de tamaño inicia el siguiente.
Elementos de listaUna línea que empieza con una viñeta, un guion, un número o una letra seguidos de punto o paréntesis se convierte en su propio elemento de lista.
ImágenesCada imagen rasterizada dibujada en la página, medida a partir de las instrucciones de dibujo, de modo que el recuadro coincide con la imagen colocada y no con el archivo interno.
Orden de lecturaLos bloques se separan por el hueco vacío más ancho, primero los medianiles verticales y luego los huecos horizontales, de modo que dos columnas bajo un título a todo el ancho se leen columna por columna.

Cómo visualizar la estructura de un PDF

  1. Seleccione un PDF. Las primeras veinte páginas se renderizan y analizan en su navegador.
  2. Recorra las páginas. La leyenda muestra cuántos bloques de cada tipo se encontraron; haga clic en un tipo para ocultarlo o mostrarlo.
  3. Haga clic en cualquier recuadro para ver su texto, tamaño de fuente y posición en la lista de la derecha.
  4. Descargue el resultado como JSON con los recuadros o como esquema Markdown que conserva títulos, elementos de lista y marcadores de imagen.

Cuándo es útil el mapa

Antes de convertir un informe, compruebe si sus títulos son títulos reales y si las columnas se leerán en el orden correcto; si el mapa se ve mal, el documento convertido también. En los documentos escaneados el mapa queda vacío, porque no hay capa de texto que leer, y la herramienta adecuada es OCR PDF a Word.

El esquema Markdown es una forma rápida de convertir un PDF en notas o en un índice. Cuando importa todo el texto y no solo su esqueleto, PDF a Markdown traslada también el cuerpo.

Qué esperar

La detección se basa en la geometría y los tamaños de fuente, no en la intención del autor. Una cita destacada grande se etiqueta como título, un párrafo con sangría francesa puede dividirse en dos, y las tablas aparecen como varios párrafos o elementos de lista en vez de como una cuadrícula. Los dibujos vectoriales, como los gráficos, no se recuadran; solo las imágenes rasterizadas.

Los PDF protegidos con contraseña no se pueden abrir aquí; use primero Desbloquear PDF. Las etiquetas de estructura se leen del archivo cuando existen, pero los recuadros se calculan a partir de la página, así que un documento sin etiquetas también obtiene un mapa completo. Para comprobar formalmente el etiquetado y la conformidad de archivo, ejecute el validador PDF/A.

Preguntas frecuentes

¿El análisis se realiza en mi navegador?

Sí. Las páginas se renderizan y los bloques se detectan en su dispositivo, y las descargas JSON y Markdown se generan localmente. La política de privacidad describe cómo se tratan en general las subidas y los datos de uso.

¿Por qué un párrafo aparece etiquetado como título?

Los títulos se reconocen por el tamaño: un bloque corto compuesto en un tamaño claramente mayor que el cuerpo cuenta como título. Una cita destacada, una línea de portada o una capitular grande superan la misma prueba. La etiqueta describe cómo está compuesta la página, no lo que quiso decir el autor.

¿Qué significa el número del orden de lectura?

Es la secuencia en la que se leerían los bloques si la página se linealizara: de arriba abajo y columna por columna donde la página tenga columnas. Es el orden que probablemente seguirá un conversor o un lector de pantalla, por eso un orden equivocado en el mapa suele anticipar un orden equivocado en el archivo convertido.

¿Por qué mi PDF escaneado no muestra bloques?

Un escaneo es una imagen de una página, así que el único bloque que la herramienta puede encontrar es la propia imagen. Pase primero el archivo por OCR para añadir una capa de texto y entonces los títulos y párrafos se harán visibles.

¿Se detectan las tablas?

No como tablas. Las celdas aparecen como párrafos pequeños o elementos de lista situados donde están las celdas, lo que aun así muestra el orden de lectura que seguirá un conversor. Para extraer tablas use PDF a Excel.

¿Qué contiene la exportación JSON?

Una entrada por página analizada con su tamaño en puntos y cada bloque en orden de lectura: tipo, texto, tamaño de fuente, indicador de negrita y un recuadro medido desde la esquina superior izquierda. La exportación Markdown conserva solo títulos, elementos de lista, párrafos y marcadores de imagen.