Vai al contenuto
Case Converter Online
it

Convertitore da PDF a Markdown

Scegli un PDF e ottieni Markdown con titoli, paragrafi ed elenchi puntati ricostruiti dall'impaginazione delle pagine. Il file viene letto sul tuo dispositivo e non viene mai caricato.

Scegli un PDF per iniziare. Funziona meglio con i PDF creati da Word, Documenti Google o da una pagina web.

Cosa fa questo convertitore

Per convertire da PDF a Markdown bisogna prima capire come è fatto un PDF. Il PDF nasce per la stampa. Registra dove va ogni frammento di testo nella pagina e con quale dimensione di carattere, ma non registra paragrafi, titoli o elenchi. Copiando il testo da un PDF ottieni spesso righe spezzate, numeri di pagina in mezzo alle frasi e nessuna struttura.

Questo convertitore legge il testo con PDF.js e ricostruisce la struttura dall’impaginazione:

  • I frammenti di testo sulla stessa riga vengono uniti, con uno spazio dove c’è uno stacco visibile.
  • Le righe vicine tra loro diventano un unico paragrafo. Uno stacco verticale più ampio ne inizia uno nuovo.
  • Il testo chiaramente più grande del corpo del testo diventa un titolo. La dimensione maggiore diventa #, la successiva ##, e così via.
  • Le righe che iniziano con un carattere da elenco, come un pallino, diventano voci di un elenco Markdown.
  • Le righe che contengono solo un numero di pagina in cima o in fondo alla pagina vengono rimosse.

Come si usa

  1. Premi Scegli un PDF oppure trascina un file .pdf sul riquadro.
  2. Aspetta mentre le pagine vengono lette. Per i file lunghi la riga di stato mostra l’avanzamento.
  3. Regola le opzioni. Il risultato si aggiorna subito, senza rileggere il file:
    • Rileva titoli trasforma il testo grande in titoli Markdown.
    • Rimuovi numeri di pagina elimina i numeri di pagina isolati.
    • Segna interruzioni di pagina inserisce una linea --- tra una pagina e l’altra.
    • Output passa da Markdown a Testo semplice e viceversa.
  4. Controlla il risultato. Anteprima lo mostra visualizzato, e puoi modificare il Markdown nel riquadro.
  5. Premi Copia o Scarica.

Esempio

Abbiamo creato un PDF di prova di due pagine. La prima pagina ha un titolo a 22 punti, titoli di sezione a 15 punti, due paragrafi a 11 punti, due righe con elenco puntato e un numero di pagina in fondo. La seconda pagina ha un titolo, una frase e un numero di pagina. Il convertitore ha restituito:

# Quarterly Report

## Overview

Revenue rose in all three regions this quarter. The largest gain came from online orders.

Costs stayed close to the plan.

## Next steps

- Hire two support staff
- Open the Leeds office

## Appendix

All figures are unaudited.

Nel PDF il primo paragrafo occupava due righe. Sono state unite in una sola, perché lo stacco tra loro era la normale interlinea. “Costs stayed close to the plan.” inizia un nuovo paragrafo perché lo stacco sopra era più ampio. Entrambi i numeri di pagina sono stati rimossi. Con Output impostato su Testo semplice, i titoli perdono i segni # e gli elenchi mantengono i pallini originali.

Cosa funziona bene e cosa no

Il risultato dipende da come è stato creato il PDF.

Funziona bene: con i PDF esportati da Word, Documenti Google, LibreOffice, Pages o da un browser. Questi contengono testo vero nell’ordine di lettura, con dimensioni dei caratteri ben distinte per i titoli.

Da controllare:

  • Impaginazioni a più colonne. Il testo viene preso nell’ordine in cui il PDF lo disegna. In alcuni documenti a due colonne l’ordine è colonna per colonna, ed è corretto. In altri le righe delle due colonne possono mescolarsi.
  • Titoli della stessa dimensione del testo. Un titolo solo in grassetto, ma non più grande, non viene riconosciuto, perché il grassetto non è segnato in modo affidabile nei dati di testo di un PDF.
  • Tabelle. Il testo delle tabelle esce come righe o brevi paragrafi. Ricostruisci la tabella con il generatore di tabelle Markdown.
  • Note a piè di pagina, intestazioni e piè di pagina. Le intestazioni ripetute compaiono su ogni pagina. Eliminale dopo la conversione.
  • Parole sillabate a fine riga vengono unite senza spazio, quindi “well-” seguito da “known” diventa “well-known”. Anche una parola divisa solo per stare nella riga mantiene il trattino, come in “infor-mation”, quindi cerca i trattini di troppo, soprattutto nei testi giustificati con la sillabazione automatica.

Non funziona:

  • PDF scansionati. Sono immagini. Lo strumento ti avvisa quando trova pochissimo testo. Prima serve l’OCR.
  • Immagini, grafici e campi dei moduli. Vengono saltati.

Il testo dei PDF in cinese, giapponese e coreano è supportato. Le mappe dei caratteri di cui PDF.js ha bisogno sono incluse in questo sito e vengono caricate solo quando un file le usa.

Consigli

Altri modi per convertire da PDF a Markdown

  • pdftotext degli strumenti Poppler estrae testo semplice dalla riga di comando. La sua opzione -layout conserva l’impaginazione usando gli spazi.
  • Python: librerie come pdfplumber e PyMuPDF ti danno il testo con le posizioni, così puoi scrivere le tue regole per titoli e tabelle.
  • Pandoc non legge i file PDF, quindi non può fare direttamente questa conversione.

Anche i PDF di centinaia di pagine funzionano, ma richiedono più tempo perché ogni pagina viene letta sul tuo dispositivo. I file oltre i 100 MB vengono rifiutati per non rallentare il browser.

Da PDF a Markdown: domande e risposte

Perché il risultato è vuoto o quasi vuoto?

Probabilmente il PDF è una scansione o una foto delle pagine. I PDF scansionati contengono immagini del testo, non testo, quindi non c'è niente da estrarre. Prima serve l'OCR (riconoscimento ottico dei caratteri). Molte app per scanner ed editor PDF possono aggiungere un livello di testo con l'OCR, dopodiché questo strumento riesce a leggere il file.

Tabelle e immagini vengono convertite?

No. Un PDF salva una tabella come frammenti di testo separati disposti a griglia, senza alcuna informazione su righe e celle. Il testo di una tabella esce come righe semplici. Le immagini vengono saltate. Se hai il file Word originale, il convertitore da Word a Markdown mantiene le tabelle.

Il mio PDF viene caricato?

No. Il PDF viene letto da PDF.js, lo stesso motore che Firefox usa per mostrare i PDF, che gira dentro il tuo browser. Il file non viene inviato a un server, quindi puoi usarlo per contratti, relazioni e altri documenti riservati.

Può aprire i PDF protetti da password?

Sì, se conosci la password. Quando un PDF è bloccato compare un campo per la password. Scrivila e premi Apri. La password viene usata solo nel tuo browser per decifrare il file.

Altri strumenti per codice e dati

Vedi tutti gli strumenti