Pular para o conteúdo
Case Converter Online
pt

Converter PDF para Markdown

Escolha um PDF e receba um Markdown com títulos, parágrafos e listas com marcadores reconstruídos a partir do layout da página. O arquivo é lido no seu aparelho e nunca é enviado.

Escolha um PDF para começar. Funciona melhor com PDFs criados no Word, no Google Docs ou a partir de uma página web.

O que este conversor faz

Um PDF foi feito para impressão. Ele registra onde fica cada pedaço de texto na página e em que tamanho de fonte, mas não registra parágrafos, títulos ou listas. Copiar o texto de um PDF muitas vezes traz linhas quebradas, números de página no meio das frases e nenhuma estrutura.

Este conversor lê o texto com o PDF.js e reconstrói a estrutura a partir do layout:

  • Pedaços de texto na mesma linha são unidos, com espaços onde há um vão visível.
  • Linhas próximas umas das outras viram um parágrafo. Um espaço vertical maior começa um novo.
  • Um texto claramente maior que o corpo do texto vira um título. O maior tamanho vira #, o seguinte ##, e assim por diante.
  • Linhas que começam com um caractere de marcador, como um ponto redondo, viram itens de lista em Markdown.
  • Linhas que só têm um número de página no topo ou no pé da página são removidas.

Como usar

  1. Clique em Escolher um PDF ou solte um arquivo .pdf na caixa.
  2. Espere enquanto as páginas são lidas. A linha de status mostra o progresso nos arquivos longos.
  3. Ajuste as opções. O resultado é atualizado na hora, sem ler o arquivo de novo:
    • Detectar títulos transforma textos grandes em títulos Markdown.
    • Remover números de página tira os números de página soltos.
    • Marcar quebras de página coloca uma linha --- entre as páginas.
    • Resultado alterna entre Markdown e Texto simples.
  4. Confira o resultado. Pré-visualização mostra tudo renderizado, e você pode editar o Markdown na caixa.
  5. Clique em Copiar ou Baixar.

Exemplo

Montamos um PDF de teste com duas páginas. A primeira página tem um título em 22 pontos, títulos de seção em 15 pontos, dois parágrafos em 11 pontos, duas linhas com marcadores e um número de página no rodapé. A segunda página tem um título, uma frase e um número de página. O conversor devolveu:

# Quarterly Report

## Overview

Revenue rose in all three regions this quarter. The largest gain came from online orders.

Costs stayed close to the plan.

## Next steps

- Hire two support staff
- Open the Leeds office

## Appendix

All figures are unaudited.

O primeiro parágrafo eram duas linhas no PDF. Elas foram unidas em uma só, porque o espaço entre elas era o espaçamento normal entre linhas. “Costs stayed close to the plan.” começa um novo parágrafo porque o espaço acima dela era maior. Os dois números de página foram removidos. Com Resultado em Texto simples, os títulos perdem as marcas # e os marcadores mantêm os pontos originais.

O que funciona bem e o que não funciona

O resultado depende de como o PDF foi gerado.

Funciona bem: PDFs exportados do Word, do Google Docs, do LibreOffice, do Pages ou de um navegador. Eles têm texto de verdade, na ordem de leitura, com tamanhos de fonte claros para os títulos. Textos em português, com acentos e cedilha, são extraídos normalmente.

Precisa de conferência:

  • Layouts com várias colunas. O texto é lido na ordem em que o PDF o desenha. Em alguns documentos de duas colunas, isso é coluna por coluna, o que está certo. Em outros, as linhas das duas colunas podem se intercalar.
  • Títulos do mesmo tamanho do corpo do texto. Um título que é só negrito, e não maior, não é detectado, porque o negrito não é marcado de forma confiável nos dados de texto do PDF.
  • Tabelas. O texto das tabelas sai como linhas ou parágrafos curtos. Reconstrua a tabela com o gerador de tabela Markdown.
  • Notas de rodapé, cabeçalhos e rodapés. Cabeçalhos repetidos aparecem em todas as páginas. Apague depois de converter.
  • Palavras com hífen no fim da linha são unidas sem espaço, então “bem-” seguido de “vindo” vira “bem-vindo”. Uma palavra que só foi dividida para caber na linha também mantém o hífen, como em “infor-mação”, então procure hifens perdidos. Em português, com as regras de separação silábica, isso aparece com frequência em textos justificados.

Não funciona:

  • PDFs digitalizados. Eles são imagens. A ferramenta avisa quando encontra pouquíssimo texto. Eles precisam de OCR antes. Se você só precisa do texto de uma página, tire um print e use a ferramenta de converter imagem em texto, que tem suporte ao português.
  • Imagens, gráficos e campos de formulário. Eles são pulados.

O texto de PDFs em chinês, japonês e coreano é aceito. Os mapas de caracteres de que o PDF.js precisa para esses idiomas vêm junto com este site e só carregam quando um arquivo os usa.

Dicas

  • Se você ainda tem o documento original, converta o original. A ferramenta de converter Word para Markdown mantém tabelas, links e níveis de títulos exatos.
  • Passe o resultado pelo formatador Markdown para quebrar ou juntar os parágrafos em um único estilo.
  • Para uma página web salva como PDF, o HTML original costuma dar um resultado mais limpo na ferramenta de converter HTML para Markdown.

Outras formas de converter PDF para Markdown

  • O pdftotext, das ferramentas Poppler, extrai texto simples na linha de comando. A opção -layout mantém o layout da página com espaços.
  • Python: bibliotecas como pdfplumber e PyMuPDF entregam o texto com as posições, para você escrever suas próprias regras para títulos e tabelas.
  • O Pandoc não lê arquivos PDF, então não faz essa conversão diretamente.

PDFs grandes, com centenas de páginas, funcionam, mas demoram mais porque cada página é lida no seu aparelho. Arquivos com mais de 100 MB são recusados para manter o navegador respondendo.

PDF para Markdown: perguntas e respostas

Por que o resultado saiu vazio ou quase vazio?

O PDF provavelmente é uma digitalização ou uma foto de páginas. Os PDFs digitalizados guardam imagens do texto, e não o texto, então não há nada para extrair. Eles precisam de OCR (reconhecimento óptico de caracteres) antes. Muitos aplicativos de digitalização e editores de PDF acrescentam uma camada de texto com OCR, e depois disso esta ferramenta consegue ler o arquivo.

Tabelas e imagens são convertidas?

Não. Um PDF guarda uma tabela como pedaços separados de texto posicionados em uma grade, sem registro de linhas e células. O texto de uma tabela sai como linhas simples. As imagens são puladas. Se você tem o arquivo original do Word, o conversor de Word para Markdown mantém as tabelas.

Meu PDF é enviado para algum lugar?

Não. O PDF é lido pelo PDF.js, o mesmo motor que o Firefox usa para mostrar PDFs, rodando dentro do seu navegador. O arquivo não é enviado para um servidor, então você pode usar a ferramenta com contratos, relatórios e outros documentos particulares.

Ele abre PDFs protegidos por senha?

Abre, se você souber a senha. Quando um PDF está bloqueado, aparece uma caixa de senha. Digite a senha e clique em Abrir. A senha só é usada no seu navegador para descriptografar o arquivo.

Mais ferramentas de código e dados

Ver todas as ferramentas