Cosa fa questo convertitore
Per convertire da PDF a Markdown bisogna prima capire come è fatto un PDF. Il PDF nasce per la stampa. Registra dove va ogni frammento di testo nella pagina e con quale dimensione di carattere, ma non registra paragrafi, titoli o elenchi. Copiando il testo da un PDF ottieni spesso righe spezzate, numeri di pagina in mezzo alle frasi e nessuna struttura.
Questo convertitore legge il testo con PDF.js e ricostruisce la struttura dall’impaginazione:
- I frammenti di testo sulla stessa riga vengono uniti, con uno spazio dove c’è uno stacco visibile.
- Le righe vicine tra loro diventano un unico paragrafo. Uno stacco verticale più ampio ne inizia uno nuovo.
- Il testo chiaramente più grande del corpo del testo diventa un titolo. La dimensione maggiore diventa
#, la successiva##, e così via. - Le righe che iniziano con un carattere da elenco, come un pallino, diventano voci di un elenco Markdown.
- Le righe che contengono solo un numero di pagina in cima o in fondo alla pagina vengono rimosse.
Come si usa
- Premi Scegli un PDF oppure trascina un file
.pdfsul riquadro. - Aspetta mentre le pagine vengono lette. Per i file lunghi la riga di stato mostra l’avanzamento.
- Regola le opzioni. Il risultato si aggiorna subito, senza rileggere il file:
- Rileva titoli trasforma il testo grande in titoli Markdown.
- Rimuovi numeri di pagina elimina i numeri di pagina isolati.
- Segna interruzioni di pagina inserisce una linea
---tra una pagina e l’altra. - Output passa da Markdown a Testo semplice e viceversa.
- Controlla il risultato. Anteprima lo mostra visualizzato, e puoi modificare il Markdown nel riquadro.
- Premi Copia o Scarica.
Esempio
Abbiamo creato un PDF di prova di due pagine. La prima pagina ha un titolo a 22 punti, titoli di sezione a 15 punti, due paragrafi a 11 punti, due righe con elenco puntato e un numero di pagina in fondo. La seconda pagina ha un titolo, una frase e un numero di pagina. Il convertitore ha restituito:
# Quarterly Report
## Overview
Revenue rose in all three regions this quarter. The largest gain came from online orders.
Costs stayed close to the plan.
## Next steps
- Hire two support staff
- Open the Leeds office
## Appendix
All figures are unaudited.
Nel PDF il primo paragrafo occupava due righe. Sono state unite in una sola, perché lo stacco tra loro era la normale interlinea. “Costs stayed close to the plan.” inizia un nuovo paragrafo perché lo stacco sopra era più ampio. Entrambi i numeri di pagina sono stati rimossi. Con Output impostato su Testo semplice, i titoli perdono i segni # e gli elenchi mantengono i pallini originali.
Cosa funziona bene e cosa no
Il risultato dipende da come è stato creato il PDF.
Funziona bene: con i PDF esportati da Word, Documenti Google, LibreOffice, Pages o da un browser. Questi contengono testo vero nell’ordine di lettura, con dimensioni dei caratteri ben distinte per i titoli.
Da controllare:
- Impaginazioni a più colonne. Il testo viene preso nell’ordine in cui il PDF lo disegna. In alcuni documenti a due colonne l’ordine è colonna per colonna, ed è corretto. In altri le righe delle due colonne possono mescolarsi.
- Titoli della stessa dimensione del testo. Un titolo solo in grassetto, ma non più grande, non viene riconosciuto, perché il grassetto non è segnato in modo affidabile nei dati di testo di un PDF.
- Tabelle. Il testo delle tabelle esce come righe o brevi paragrafi. Ricostruisci la tabella con il generatore di tabelle Markdown.
- Note a piè di pagina, intestazioni e piè di pagina. Le intestazioni ripetute compaiono su ogni pagina. Eliminale dopo la conversione.
- Parole sillabate a fine riga vengono unite senza spazio, quindi “well-” seguito da “known” diventa “well-known”. Anche una parola divisa solo per stare nella riga mantiene il trattino, come in “infor-mation”, quindi cerca i trattini di troppo, soprattutto nei testi giustificati con la sillabazione automatica.
Non funziona:
- PDF scansionati. Sono immagini. Lo strumento ti avvisa quando trova pochissimo testo. Prima serve l’OCR.
- Immagini, grafici e campi dei moduli. Vengono saltati.
Il testo dei PDF in cinese, giapponese e coreano è supportato. Le mappe dei caratteri di cui PDF.js ha bisogno sono incluse in questo sito e vengono caricate solo quando un file le usa.
Consigli
- Se hai ancora il documento originale, converti quello. Il convertitore da Word a Markdown mantiene tabelle, link e livelli esatti dei titoli.
- Passa il risultato nel formattatore Markdown per mandare a capo o riunire i paragrafi in un unico stile.
- Per una pagina web salvata come PDF, l’HTML originale dà spesso un risultato più pulito nel convertitore da HTML a Markdown.
Altri modi per convertire da PDF a Markdown
- pdftotext degli strumenti Poppler estrae testo semplice dalla riga di comando. La sua opzione
-layoutconserva l’impaginazione usando gli spazi. - Python: librerie come pdfplumber e PyMuPDF ti danno il testo con le posizioni, così puoi scrivere le tue regole per titoli e tabelle.
- Pandoc non legge i file PDF, quindi non può fare direttamente questa conversione.
Anche i PDF di centinaia di pagine funzionano, ma richiedono più tempo perché ogni pagina viene letta sul tuo dispositivo. I file oltre i 100 MB vengono rifiutati per non rallentare il browser.