Was dieser Konverter macht
Eine PDF ist zum Drucken gebaut. Sie speichert, wo jedes Textstück auf der Seite steht und in welcher Schriftgröße, aber keine Absätze, Überschriften oder Listen. Wenn du Text aus einer PDF kopierst, bekommst du oft zerbrochene Zeilen, Seitenzahlen mitten in Sätzen und gar keine Struktur.
Dieser Konverter liest den Text mit PDF.js und baut die Struktur aus dem Layout wieder auf:
- Textstücke in derselben Zeile werden verbunden, mit Leerzeichen dort, wo eine sichtbare Lücke ist.
- Zeilen, die dicht beieinanderstehen, werden zu einem Absatz. Eine größere senkrechte Lücke beginnt einen neuen.
- Text, der deutlich größer ist als der Fließtext, wird zur Überschrift. Die größte Schrift wird zu
#, die nächste zu##und so weiter. - Zeilen, die mit einem Aufzählungszeichen wie einem runden Punkt beginnen, werden zu Markdown-Listenpunkten.
- Zeilen, die oben oder unten auf einer Seite nur eine Seitenzahl enthalten, werden entfernt.
So nutzt du ihn
- Klicke auf PDF auswählen oder zieh eine
.pdf-Datei auf das Feld. - Warte, während die Seiten gelesen werden. Bei langen Dateien zeigt die Statuszeile den Fortschritt.
- Pass die Optionen an. Das Ergebnis aktualisiert sich sofort, ohne die Datei neu zu lesen:
- Überschriften erkennen macht großen Text zu Markdown-Überschriften.
- Seitenzahlen entfernen entfernt einzeln stehende Seitenzahlen.
- Seitenumbrüche markieren setzt eine Linie
---zwischen die Seiten. - Ausgabe wechselt zwischen Markdown und Reiner Text.
- Prüf das Ergebnis. Vorschau zeigt es dargestellt, und du kannst das Markdown im Feld bearbeiten.
- Klicke auf Kopieren oder Herunterladen.
Beispiel
Wir haben eine zweiseitige Test-PDF erstellt. Seite eins hat einen Titel in 22 Punkt, Abschnittsüberschriften in 15 Punkt, zwei Absätze in 11 Punkt, zwei Zeilen mit Aufzählungspunkten und unten eine Seitenzahl. Seite zwei hat eine Überschrift, einen Satz und eine Seitenzahl. Der Konverter lieferte:
# Quarterly Report
## Overview
Revenue rose in all three regions this quarter. The largest gain came from online orders.
Costs stayed close to the plan.
## Next steps
- Hire two support staff
- Open the Leeds office
## Appendix
All figures are unaudited.
Der erste Absatz bestand in der PDF aus zwei Zeilen. Sie wurden zu einer verbunden, weil der Abstand zwischen ihnen normaler Zeilenabstand war. „Costs stayed close to the plan.“ beginnt einen neuen Absatz, weil der Abstand darüber größer war. Beide Seitenzahlen wurden entfernt. Mit Ausgabe auf Reiner Text verlieren die Überschriften ihre #-Zeichen, und die Aufzählungen behalten ihre ursprünglichen Punktzeichen.
Was gut funktioniert und was nicht
Das Ergebnis hängt davon ab, wie die PDF entstanden ist.
Funktioniert gut: PDFs, die aus Word, Google Docs, LibreOffice, Pages oder einem Webbrowser exportiert wurden. Sie enthalten echten Text in Lesereihenfolge und klare Schriftgrößen für Überschriften.
Muss geprüft werden:
- Mehrspaltige Layouts. Der Text wird in der Reihenfolge übernommen, in der die PDF ihn zeichnet. In manchen zweispaltigen Dokumenten ist das Spalte für Spalte, was richtig ist. In anderen können Zeilen aus beiden Spalten durcheinandergeraten.
- Überschriften in der Größe des Fließtexts. Eine Überschrift, die nur fett, aber nicht größer ist, wird nicht erkannt, weil Fettschrift in PDF-Textdaten nicht zuverlässig markiert ist.
- Tabellen. Tabellentext kommt als Zeilen oder kurze Absätze heraus. Bau die Tabelle mit dem Generator Markdown-Tabelle erstellen neu.
- Fußnoten, Kopf- und Fußzeilen. Wiederkehrende Kopfzeilen erscheinen auf jeder Seite. Lösch sie nach dem Umwandeln.
- Silbentrennung am Zeilenende wird ohne Leerzeichen verbunden, aus „well-“ gefolgt von „known“ wird also „well-known“. Auch ein Wort, das nur für den Zeilenumbruch getrennt wurde, behält seinen Bindestrich, etwa „infor-mation“. Bei deutschen Texten mit langen Wörtern und Blocksatz kommt das oft vor, aus „Rechnungs-“ und „stellung“ wird zum Beispiel „Rechnungs-stellung“. Such nach dem Umwandeln gezielt nach solchen Bindestrichen.
Funktioniert nicht:
- Gescannte PDFs. Das sind Bilder. Das Tool warnt dich, wenn es sehr wenig Text findet. Sie brauchen zuerst eine Texterkennung.
- Bilder, Diagramme und Formularfelder. Sie werden übersprungen.
Umlaute und ß kommen in normal erzeugten PDFs korrekt heraus. Text in chinesischen, japanischen und koreanischen PDFs wird ebenfalls unterstützt. Die Zeichentabellen, die PDF.js dafür braucht, liegen auf dieser Seite bereit und werden nur geladen, wenn eine Datei sie nutzt.
Tipps
- Wenn du das Quelldokument noch hast, wandle lieber das um. Der Konverter Word in Markdown behält Tabellen, Links und genaue Überschriftenebenen.
- Schick das Ergebnis durch den Markdown Formatter, um Absätze einheitlich umzubrechen oder zusammenzufügen.
- Bei einer Webseite, die als PDF gespeichert wurde, liefert das ursprüngliche HTML im Konverter HTML in Markdown oft ein saubereres Ergebnis.
Andere Wege, PDF in Markdown umzuwandeln
- pdftotext aus den Poppler-Tools extrahiert reinen Text auf der Kommandozeile. Die Option
-layoutbehält das Seitenlayout mit Leerzeichen bei. - Python: Bibliotheken wie pdfplumber und PyMuPDF liefern Text mit Positionen, sodass du eigene Regeln für Überschriften und Tabellen schreiben kannst.
- Pandoc liest keine PDF-Dateien und kann diese Umwandlung deshalb nicht direkt.
Große PDFs mit Hunderten Seiten funktionieren, dauern aber länger, weil jede Seite auf deinem Gerät gelesen wird. Dateien über 100 MB werden abgelehnt, damit der Browser reaktionsfähig bleibt.