Kurz gesagt
CommonMark, die präzise Markdown-Spezifikation, derzeit in Version 0.31.2, hält Struktur in reinem Text fest: # markiert eine Überschrift, - einen Listenpunkt. pd00 liest die Textebene eines PDFs mit pdf.js und schreibt eine .md-Datei, in der Zeilen, die mindestens 12 % größer sind als der Fließtext, zu Überschriften von # bis ### werden, Zeilen mit Aufzählungszeichen oder Nummern zu Listen und jeder Seitenumbruch zu einer Linie ---.
So nutzen Sie „PDF in Markdown“
- Ein PDF mit Text ladenWählen Sie ein PDF aus oder ziehen Sie es auf das Werkzeug. Es braucht eine Textebene: Lassen sich in Ihrem PDF-Viewer keine Wörter markieren, ist die Datei ein Scan, den Sie zuerst mit „PDF OCR“ bearbeiten sollten.
- Die Vorschau durchlesenDas neu aufgebaute Markdown erscheint auf der Seite. Prüfen Sie, ob Überschriften und Listen dort gelandet sind, wo Sie sie erwarten, vor allem in Dokumenten mit Spalten oder Tabellen.
- Kopieren oder als .md behaltenKlicken Sie auf „Text kopieren“, um das Markdown in einen Editor, ein Wiki oder einen Chat einzufügen, oder laden Sie es als .md-Datei herunter und legen Sie es zu Ihren übrigen Notizen.
Ein Beispiel mit Zahlen
Ein zweiseitiger Leitfaden, leitfaden.pdf, setzt den Fließtext in 10 pt, den Titel in 18 pt, Abschnittsüberschriften in 14 pt und Unterüberschriften in 12 pt; die Arbeitsschritte sind mit „•“ markiert. Die entstehende leitfaden.md enthält:
#für den Titel in 18 pt,##für die Überschriften in 14 pt und###für die Unterüberschriften in 12 pt (12 ÷ 10 = 1,2, also über der Schwelle von 1,12);-anstelle jedes „•“;- eine Zeile
---dort, wo Seite 2 beginnt.
Eine Zeile in 11 pt bleibt Fließtext (11 ÷ 10 = 1,1). Die Ausnahme ist eine fette Zeile mit weniger als 80 Zeichen, die kein Listenpunkt ist und nicht auf Punkt, Doppelpunkt, Semikolon oder Komma endet: Auch sie wird zur Überschrift ###.
Was es kann und wo die Grenzen liegen
- Braucht eine Textebene: Aus einem Scan entsteht kein Markdown, bis PDF OCR eine hinzugefügt hat.
- Tabellen werden zu einfachen Zeilen, nicht zu Tabellen in GitHub Flavored Markdown, und Bilder fallen weg; speichern Sie diese mit Bilder aus PDF extrahieren.
- Nur drei Überschriftenebenen: Eine vierte oder noch kleinere Überschriftengröße wird ebenfalls als
###geschrieben. - Fett, kursiv und Links werden nicht ausgezeichnet, und in zweispaltigen Layouts können sich Zeilen benachbarter Spalten abwechseln.
Quellen
- CommonMark Spec CommonMark
- GitHub Flavored Markdown Spec GitHub
- PDF.js Mozilla
Links geprüft am 10. Oktober 2026.
Mehr über „PDF in Markdown“
Ein PDF hält fest, wo jedes Textstück auf der Seite steht und wie groß es ist, verrät aber selten, welche Zeile eine Überschrift ist oder welche Zeilen zu einer Liste gehören. Dieser Konverter liest die Textebene mit pdf.js, trifft diese Entscheidungen selbst und schreibt das Ergebnis als Markdown:
- Überschriften werden aus Text erschlossen, der in einer größeren Schrift als der Fließtext gesetzt ist.
- Listen entstehen aus Zeilen, die mit einem Aufzählungszeichen oder einer Nummer beginnen; daraus werden Aufzählungen oder nummerierte Punkte.
- Absätze werden wieder zusammengefügt: Zeilen, die das PDF am rechten Rand umbrochen hat, fließen wieder ineinander, sodass Sie nicht alle paar Wörter einen harten Zeilenumbruch bekommen.
- Seitenumbrüche werden mit einer horizontalen Linie markiert,
---.
Das Markdown erscheint in einer Vorschau auf der Seite. Die Schaltfläche Text kopieren legt alles in Ihre Zwischenablage, oder Sie speichern es als .md-Datei. Als reiner Text öffnet sich das Ergebnis in jedem Editor und passt direkt in Wikis, Notiz-Apps und Dokumentationsseiten, die Markdown verwenden.
Betrachten Sie die Struktur als ersten Entwurf
Jede Überschrift und jede Liste in der Ausgabe ist aus optischen Hinweisen erschlossen. Eine fett gesetzte Überschrift in Fließtextgröße kann als gewöhnliche Zeile herauskommen, während ein groß gesetztes Zitat zur Überschrift befördert werden kann. Überfliegen Sie die Vorschau, bevor Sie sich darauf verlassen, besonders bei langen oder aufwendig gestalteten Dokumenten.
Typische Anwendungsfälle
Ein altes Handbuch ins Wiki übernehmen
Eine Produktanleitung, die nur noch als PDF existiert, kann zu Markdown-Seiten werden, deren Abschnittsüberschriften und Schrittlisten erhalten bleiben, bereit, in Themen aufgeteilt und in Ihrem Dokumentationssystem bearbeitet zu werden.
Einen Bericht bearbeiten, dessen Quelldatei verloren ist
Ist die ursprüngliche Textverarbeitungsdatei weg, liefert Markdown Ihnen bearbeitbaren Text mit intakter Gliederung. Nehmen Sie Ihre Änderungen vor und erzeugen Sie dann mit „Markdown in PDF“ ein frisches PDF.
Ein langes Dokument an einen KI-Assistenten geben
Chat-Assistenten lesen Markdown mühelos, und die Überschriftenzeichen zeigen ihnen, in welchem Abschnitt ein Absatz steht. Fügen Sie die Abschnitte ein, die Sie brauchen, statt das ganze PDF anzuhängen.
Tabellen, Bilder und mehrspaltige Seiten
Tabellen werden nicht als Markdown-Tabellen wiederhergestellt. In einem PDF ist eine Tabelle nur eine Menge von Wörtern an bestimmten Koordinaten, ohne Angaben zu Zeilen oder Zellen, deshalb kommt der Zellinhalt als einzelne Textzeilen heraus. Bauen Sie wichtige Tabellen von Hand nach, oder halten Sie mit PDF in PNG ein originalgetreues Bild der Seite fest.
Bilder fehlen im Markdown. Um Fotos, Diagramme und Abbildungen zu behalten, speichern Sie sie mit Bilder aus PDF extrahieren und verlinken Sie sie selbst in Ihrem Markdown.
Mehrspaltige Layouts wie Newsletter und wissenschaftliche Aufsätze können durcheinandergeraten, wobei sich Zeilen benachbarter Spalten abwechseln. Einspaltige Dokumente, die aus einer Textverarbeitung oder von einer Webseite exportiert wurden, liefern das sauberste Ergebnis.
Scans brauchen zuerst eine Textebene
Ein gescanntes PDF enthält Seitenbilder und keine Zeichen; dieses Werkzeug hat also nichts zu lesen, und das Markdown bleibt leer. Schicken Sie die Datei durch PDF OCR, das die Wörter erkennt und eine unsichtbare Textebene hinzufügt, und bringen Sie die neue Datei dann hierher zurück. OCR hat eine eigene Fehlerquote, lesen Sie Namen und Zahlen im Ergebnis also gegen.
Markdown, reiner Text oder Bilder: welches Ergebnis passt
- Markdown (dieses Werkzeug), wenn Sie die Gliederung des Dokuments wollen: Überschriften, Listen und saubere Absätze, an denen Sie weiterarbeiten können.
- Reiner Text aus PDF in Text, wenn Sie die Wörter genau so wollen, wie sie gespeichert sind, mit Seitenmarkierungen und ohne Vermutungen über die Struktur.
- Bilder aus PDF in PNG, wenn das genaue Aussehen jeder Seite wichtiger ist als bearbeitbarer Text.
Was übernommen wird und wo die Umwandlung stattfindet
Zeichen werden genau so übernommen, wie das PDF sie speichert, durch Auflösung oder Kompression geht also nichts verloren. Was Markdown nicht beschreiben kann, bleibt zurück: Schriften, Farben, Abstände und die genaue Position der Elemente auf der Seite. Die entstehende .md-Datei ist klein, denn sie enthält nur Text und ein paar Formatierungszeichen. Ist die Datei gesperrt, entfernen Sie ihr Passwort mit PDF-Passwort entfernen (Sie müssen es kennen) und wandeln Sie die entsperrte Kopie um.
Die Umwandlung geschieht in diesem Browser-Tab, und weder das PDF noch das Markdown wird hochgeladen; in wenigen Schritten können Sie das selbst bestätigen.