Saltar al contenido
Case Converter Online
es

Convertir PDF a Markdown

Elige un PDF y obtén Markdown con encabezados, párrafos y listas de viñetas reconstruidos a partir del diseño de la página. El archivo se lee en tu dispositivo y nunca se sube.

Elige un PDF para empezar. Funciona mejor con PDF creados desde Word, Google Docs o una página web.

Qué hace este convertidor

Un PDF está pensado para imprimir. Registra dónde va cada trozo de texto en la página y con qué tamaño de letra, pero no registra párrafos, encabezados ni listas. Al copiar texto de un PDF sueles obtener líneas cortadas, números de página en mitad de las frases y ninguna estructura.

Para convertir PDF a Markdown, esta herramienta lee el texto con PDF.js y reconstruye la estructura a partir del diseño:

  • Los trozos de texto de una misma línea se unen, con espacios donde hay un hueco visible.
  • Las líneas que están juntas forman un párrafo. Un espacio vertical mayor empieza uno nuevo.
  • El texto claramente más grande que el cuerpo se convierte en encabezado. El tamaño mayor pasa a ser #, el siguiente ##, y así sucesivamente.
  • Las líneas que empiezan con un carácter de viñeta, como un punto redondo, se convierten en elementos de lista de Markdown.
  • Las líneas que solo contienen un número de página arriba o abajo de la página se eliminan.

Cómo usarlo

  1. Pulsa Elegir un PDF o arrastra un archivo .pdf al cuadro.
  2. Espera mientras se leen las páginas. En los archivos largos, la línea de estado muestra el progreso.
  3. Ajusta las opciones. El resultado se actualiza al momento, sin volver a leer el archivo:
    • Detectar encabezados convierte el texto grande en encabezados de Markdown.
    • Quitar números de página elimina los números de página sueltos.
    • Marcar saltos de página pone una línea --- entre páginas.
    • Resultado cambia entre Markdown y Texto plano.
  4. Revisa el resultado. Vista previa lo muestra renderizado, y puedes editar el Markdown en el cuadro.
  5. Pulsa Copiar o Descargar.

Ejemplo

Hicimos un PDF de prueba de dos páginas. La primera tiene un título de 22 puntos, encabezados de sección de 15 puntos, dos párrafos de 11 puntos, dos líneas con viñetas y un número de página abajo. La segunda tiene un encabezado, una frase y un número de página. El convertidor devolvió:

# Quarterly Report

## Overview

Revenue rose in all three regions this quarter. The largest gain came from online orders.

Costs stayed close to the plan.

## Next steps

- Hire two support staff
- Open the Leeds office

## Appendix

All figures are unaudited.

El primer párrafo ocupaba dos líneas en el PDF. Se unieron en una, porque el espacio entre ellas era el interlineado normal. “Costs stayed close to the plan.” empieza un párrafo nuevo porque el espacio encima era mayor. Los dos números de página se eliminaron. Con Resultado en Texto plano, los encabezados pierden sus marcas # y las viñetas conservan sus puntos originales.

Qué funciona bien y qué no

El resultado depende de cómo se creó el PDF.

Funciona bien: los PDF exportados desde Word, Google Docs, LibreOffice, Pages o un navegador web. Contienen texto real en orden de lectura, con tamaños de letra claros para los encabezados.

Conviene revisar:

  • Diseños a varias columnas. El texto se toma en el orden en que el PDF lo dibuja. En algunos documentos a dos columnas eso es columna por columna, que es lo correcto. En otros, las líneas de las dos columnas pueden mezclarse.
  • Encabezados del mismo tamaño que el texto. Un encabezado que solo está en negrita, sin ser más grande, no se detecta, porque la negrita no se marca de forma fiable en los datos de texto de un PDF.
  • Tablas. El texto de una tabla sale como líneas o párrafos cortos. Reconstruye la tabla con el generador de tablas Markdown.
  • Notas al pie, encabezados y pies de página. Los encabezados de página repetidos aparecen en cada página. Bórralos después de convertir.
  • Palabras con guion al final de la línea se unen sin espacio, así que “well-” seguido de “known” da “well-known”. Una palabra que se partió solo para que cupiera en la línea también conserva el guion, como en “infor-mation”, así que busca guiones sueltos. En español esto es frecuente, porque los textos justificados se dividen mucho: “infor-” y “mación” dan “infor-mación”. Si la línea siguiente empieza por ñ o por una vocal con tilde, además queda un espacio: “compa-” y “ñía” dan “compa- ñía”.
  • Números de página en español. Se quitan las líneas con solo un número, como “3”, y las formas “3/10” y “Page 3”. Las líneas como “Página 3” o “3 de 10” no se reconocen como número de página y se quedan en el texto, así que bórralas a mano.

No funciona:

  • PDF escaneados. Son imágenes. La herramienta te avisa cuando encuentra muy poco texto. Primero necesitan OCR.
  • Imágenes, gráficos y campos de formulario. Se omiten.

Se admite el texto de PDF en chino, japonés y coreano. Los mapas de caracteres que PDF.js necesita para estos idiomas vienen incluidos en este sitio y solo se cargan cuando un archivo los usa. Las tildes, la ñ y los signos ¿ y ¡ de los PDF en español se extraen como texto normal.

Consejos

  • Si todavía tienes el documento original, conviértelo a él. El convertidor de Word a Markdown conserva las tablas, los enlaces y los niveles exactos de los encabezados.
  • Pasa el resultado por el formateador Markdown para ajustar o desajustar los párrafos con un mismo estilo.
  • Para una página web guardada como PDF, el HTML original suele dar un resultado más limpio con el convertidor de HTML a Markdown.

Otras formas de convertir PDF a Markdown

  • pdftotext, de las herramientas Poppler, extrae texto plano desde la línea de comandos. Su opción -layout conserva el diseño de la página con espacios.
  • Python: bibliotecas como pdfplumber y PyMuPDF te dan el texto con sus posiciones, así que puedes escribir tus propias reglas para encabezados y tablas.
  • Pandoc no lee archivos PDF, así que no puede hacer esta conversión directamente.

Los PDF grandes, de cientos de páginas, funcionan, pero tardan más porque cada página se lee en tu dispositivo. Los archivos de más de 100 MB se rechazan para que el navegador siga respondiendo.

PDF a Markdown: preguntas y respuestas

¿Por qué el resultado sale vacío o casi vacío?

Probablemente el PDF es un escaneo o una foto de páginas. Los PDF escaneados contienen imágenes del texto, no texto, así que no hay nada que extraer. Primero necesitan OCR (reconocimiento óptico de caracteres). Muchas apps de escáner y editores de PDF pueden añadir una capa de texto con OCR, y después esta herramienta ya puede leer el archivo.

¿Se convierten las tablas y las imágenes?

No. Un PDF guarda una tabla como trozos de texto sueltos colocados en una cuadrícula, sin ningún registro de filas ni celdas. El texto de una tabla sale como líneas normales. Las imágenes se omiten. Si tienes el archivo de Word original, el convertidor de Word a Markdown conserva las tablas.

¿Se sube mi PDF?

No. El PDF lo lee PDF.js, el mismo motor que usa Firefox para mostrar los PDF, que funciona dentro de tu navegador. El archivo no se envía a ningún servidor, así que puedes usarlo con contratos, informes y otros documentos privados.

¿Puede abrir PDF protegidos con contraseña?

Sí, si conoces la contraseña. Cuando un PDF está bloqueado, aparece un cuadro para la contraseña. Escríbela y pulsa Abrir. La contraseña solo se usa en tu navegador para descifrar el archivo.

Más herramientas de código y datos

Ver todas las herramientas