Qué hace este convertidor
Un PDF está pensado para imprimir. Registra dónde va cada trozo de texto en la página y con qué tamaño de letra, pero no registra párrafos, encabezados ni listas. Al copiar texto de un PDF sueles obtener líneas cortadas, números de página en mitad de las frases y ninguna estructura.
Para convertir PDF a Markdown, esta herramienta lee el texto con PDF.js y reconstruye la estructura a partir del diseño:
- Los trozos de texto de una misma línea se unen, con espacios donde hay un hueco visible.
- Las líneas que están juntas forman un párrafo. Un espacio vertical mayor empieza uno nuevo.
- El texto claramente más grande que el cuerpo se convierte en encabezado. El tamaño mayor pasa a ser
#, el siguiente##, y así sucesivamente. - Las líneas que empiezan con un carácter de viñeta, como un punto redondo, se convierten en elementos de lista de Markdown.
- Las líneas que solo contienen un número de página arriba o abajo de la página se eliminan.
Cómo usarlo
- Pulsa Elegir un PDF o arrastra un archivo
.pdfal cuadro. - Espera mientras se leen las páginas. En los archivos largos, la línea de estado muestra el progreso.
- Ajusta las opciones. El resultado se actualiza al momento, sin volver a leer el archivo:
- Detectar encabezados convierte el texto grande en encabezados de Markdown.
- Quitar números de página elimina los números de página sueltos.
- Marcar saltos de página pone una línea
---entre páginas. - Resultado cambia entre Markdown y Texto plano.
- Revisa el resultado. Vista previa lo muestra renderizado, y puedes editar el Markdown en el cuadro.
- Pulsa Copiar o Descargar.
Ejemplo
Hicimos un PDF de prueba de dos páginas. La primera tiene un título de 22 puntos, encabezados de sección de 15 puntos, dos párrafos de 11 puntos, dos líneas con viñetas y un número de página abajo. La segunda tiene un encabezado, una frase y un número de página. El convertidor devolvió:
# Quarterly Report
## Overview
Revenue rose in all three regions this quarter. The largest gain came from online orders.
Costs stayed close to the plan.
## Next steps
- Hire two support staff
- Open the Leeds office
## Appendix
All figures are unaudited.
El primer párrafo ocupaba dos líneas en el PDF. Se unieron en una, porque el espacio entre ellas era el interlineado normal. “Costs stayed close to the plan.” empieza un párrafo nuevo porque el espacio encima era mayor. Los dos números de página se eliminaron. Con Resultado en Texto plano, los encabezados pierden sus marcas # y las viñetas conservan sus puntos originales.
Qué funciona bien y qué no
El resultado depende de cómo se creó el PDF.
Funciona bien: los PDF exportados desde Word, Google Docs, LibreOffice, Pages o un navegador web. Contienen texto real en orden de lectura, con tamaños de letra claros para los encabezados.
Conviene revisar:
- Diseños a varias columnas. El texto se toma en el orden en que el PDF lo dibuja. En algunos documentos a dos columnas eso es columna por columna, que es lo correcto. En otros, las líneas de las dos columnas pueden mezclarse.
- Encabezados del mismo tamaño que el texto. Un encabezado que solo está en negrita, sin ser más grande, no se detecta, porque la negrita no se marca de forma fiable en los datos de texto de un PDF.
- Tablas. El texto de una tabla sale como líneas o párrafos cortos. Reconstruye la tabla con el generador de tablas Markdown.
- Notas al pie, encabezados y pies de página. Los encabezados de página repetidos aparecen en cada página. Bórralos después de convertir.
- Palabras con guion al final de la línea se unen sin espacio, así que “well-” seguido de “known” da “well-known”. Una palabra que se partió solo para que cupiera en la línea también conserva el guion, como en “infor-mation”, así que busca guiones sueltos. En español esto es frecuente, porque los textos justificados se dividen mucho: “infor-” y “mación” dan “infor-mación”. Si la línea siguiente empieza por ñ o por una vocal con tilde, además queda un espacio: “compa-” y “ñía” dan “compa- ñía”.
- Números de página en español. Se quitan las líneas con solo un número, como “3”, y las formas “3/10” y “Page 3”. Las líneas como “Página 3” o “3 de 10” no se reconocen como número de página y se quedan en el texto, así que bórralas a mano.
No funciona:
- PDF escaneados. Son imágenes. La herramienta te avisa cuando encuentra muy poco texto. Primero necesitan OCR.
- Imágenes, gráficos y campos de formulario. Se omiten.
Se admite el texto de PDF en chino, japonés y coreano. Los mapas de caracteres que PDF.js necesita para estos idiomas vienen incluidos en este sitio y solo se cargan cuando un archivo los usa. Las tildes, la ñ y los signos ¿ y ¡ de los PDF en español se extraen como texto normal.
Consejos
- Si todavía tienes el documento original, conviértelo a él. El convertidor de Word a Markdown conserva las tablas, los enlaces y los niveles exactos de los encabezados.
- Pasa el resultado por el formateador Markdown para ajustar o desajustar los párrafos con un mismo estilo.
- Para una página web guardada como PDF, el HTML original suele dar un resultado más limpio con el convertidor de HTML a Markdown.
Otras formas de convertir PDF a Markdown
- pdftotext, de las herramientas Poppler, extrae texto plano desde la línea de comandos. Su opción
-layoutconserva el diseño de la página con espacios. - Python: bibliotecas como pdfplumber y PyMuPDF te dan el texto con sus posiciones, así que puedes escribir tus propias reglas para encabezados y tablas.
- Pandoc no lee archivos PDF, así que no puede hacer esta conversión directamente.
Los PDF grandes, de cientos de páginas, funcionan, pero tardan más porque cada página se lee en tu dispositivo. Los archivos de más de 100 MB se rechazan para que el navegador siga respondiendo.