Visualizador de estrutura de documento PDF

Visualize a estrutura de um PDF no navegador: títulos, parágrafos, listas e imagens destacados em cada página na ordem de leitura, mais marcadores e tags. Exporte em JSON ou Markdown.

PDF

ou arraste e solte o arquivo aqui

PDF

Conversão rápidaProcessamento seguroSem cadastro

O que o visualizador de estrutura mostra

Envie um PDF e cada página é desenhada com caixas coloridas em volta de cada bloco que a ferramenta encontra: títulos em três níveis, parágrafos, itens de lista e imagens. Cada caixa traz um número, e a lista ao lado da página repete os blocos nessa ordem, para que você veja a sequência que um conversor ou um leitor de tela seguiria.

Clique em uma caixa ou em um item da lista para destacá-lo nos dois lugares, e ligue ou desligue tipos de bloco para focar em um único tipo de elemento. Marcadores e, em PDFs com tags, as tags de estrutura da primeira página também são listados. Se o objetivo é uma cópia editável e não um mapa, PDF para Word faz a conversão.

Como os blocos são detectados

ElementoComo é reconhecido
TítulosBlocos curtos compostos em tamanho visivelmente maior que o texto do corpo. O maior tamanho vira Título 1, o seguinte Título 2, depois Título 3. Uma única linha em negrito no tamanho do corpo é tratada como título menor.
ParágrafosLinhas do mesmo tamanho, próximas e sobrepostas horizontalmente, são unidas em um bloco; um espaço maior ou uma mudança de tamanho inicia o próximo.
Itens de listaUma linha que começa com marcador, travessão, número ou letra seguidos de ponto ou parêntese vira um item de lista próprio.
ImagensCada imagem rasterizada desenhada na página, medida a partir das instruções de desenho, de modo que a caixa corresponde à imagem posicionada e não ao arquivo dentro dela.
Ordem de leituraOs blocos são separados pelo maior espaço vazio, calhas verticais antes de espaços horizontais, de modo que duas colunas sob um título de largura total são lidas coluna por coluna.

Como visualizar a estrutura de um PDF

  1. Selecione um PDF. As primeiras vinte páginas são renderizadas e analisadas no seu navegador.
  2. Percorra as páginas. A legenda mostra quantos blocos de cada tipo foram encontrados; clique em um tipo para ocultá-lo ou exibi-lo.
  3. Clique em qualquer caixa para ver seu texto, tamanho da fonte e posição na lista à direita.
  4. Baixe o resultado como JSON com as caixas delimitadoras ou como estrutura em Markdown que mantém títulos, itens de lista e marcadores de imagem.

Quando o mapa é útil

Antes de converter um relatório, verifique se os títulos são títulos de verdade e se as colunas serão lidas na ordem certa; se o mapa parecer errado, o documento convertido também ficará. Em documentos escaneados o mapa fica vazio, porque não há camada de texto para ler, e a ferramenta certa é OCR PDF para Word.

A estrutura em Markdown é um jeito rápido de transformar um PDF em notas ou em um sumário. Quando o texto inteiro importa, e não só o esqueleto, PDF para Markdown traz também o corpo.

O que esperar

A detecção parte da geometria e dos tamanhos de fonte, não da intenção do autor. Uma citação em destaque grande é rotulada como título, um parágrafo com recuo deslocado pode se dividir em dois, e tabelas aparecem como vários parágrafos ou itens de lista, não como grade. Desenhos vetoriais, como gráficos, não recebem caixa; só imagens rasterizadas.

PDFs protegidos por senha não abrem aqui; use antes o Desbloquear PDF. Tags de estrutura são lidas do arquivo quando existem, mas as caixas são calculadas a partir da página, então um documento sem tags também ganha um mapa completo. Para verificar formalmente as tags e a conformidade de arquivamento, rode o validador PDF/A.

Perguntas frequentes

A análise acontece no meu navegador?

Sim. As páginas são renderizadas e os blocos detectados no seu dispositivo, e os downloads JSON e Markdown são gerados localmente. A política de privacidade descreve como uploads e dados de uso são tratados em geral.

Por que um parágrafo aparece rotulado como título?

Títulos são reconhecidos pelo tamanho: um bloco curto composto em tamanho visivelmente maior que o corpo conta como título. Uma citação em destaque, uma linha de capa ou uma capitular grande passam no mesmo teste. O rótulo descreve como a página foi composta, não o que o autor quis dizer.

O que significa o número da ordem de leitura?

É a sequência em que os blocos seriam lidos se a página fosse linearizada: de cima para baixo e coluna por coluna onde a página tem colunas. É a ordem que um conversor ou um leitor de tela provavelmente seguirá, por isso uma ordem errada no mapa costuma prever uma ordem errada no arquivo convertido.

Por que meu PDF escaneado não mostra blocos?

Um escaneado é uma imagem da página, então o único bloco que a ferramenta consegue achar é a própria imagem. Passe o arquivo antes pelo OCR para adicionar uma camada de texto, e os títulos e parágrafos aparecerão.

Tabelas são detectadas?

Não como tabelas. As células aparecem como parágrafos pequenos ou itens de lista posicionados onde estão as células, o que ainda assim mostra a ordem de leitura que um conversor vai seguir. Para extrair tabelas use PDF para Excel.

O que há na exportação JSON?

Uma entrada por página analisada com seu tamanho em pontos e cada bloco em ordem de leitura: tipo, texto, tamanho da fonte, indicador de negrito e caixa delimitadora medida a partir do canto superior esquerdo. A exportação em Markdown mantém só títulos, itens de lista, parágrafos e marcadores de imagem.