Kurz gesagt
Ein PDF, das aus einer Textverarbeitung oder von einer Webseite exportiert wurde, enthält seine Wörter als echte Zeichen; pd00 liest sie mit pdf.js und speichert eine UTF-8-.txt-Datei mit einer Zeile --- Page N --- vor jeder Seite. UTF-8 kodiert jedes Unicode-Zeichen in 1 bis 4 Byte, sodass Umlaute, Akzente, Kyrillisch und Chinesisch unversehrt ankommen. Gescannte Seiten enthalten keine Zeichen und bleiben leer.
So nutzen Sie „PDF in Text“
- PDF hinzufügenWählen Sie ein PDF von Ihrem Gerät aus oder ziehen Sie es auf das Werkzeug. Eine Datei, die nach einem Passwort fragt, muss erst entsperrt werden, bevor sich ihr Text lesen lässt.
- Extrahierten Text prüfenStarten Sie die Extraktion, und der Text erscheint Seite für Seite in der Vorschau, getrennt durch Zeilen wie --- Page N ---. Überfliegen Sie ihn, um sicherzugehen, dass die Lesereihenfolge stimmt.
- Kopieren oder als .txt speichernKlicken Sie auf „Text kopieren“, um den gesamten Text in die Zwischenablage zu legen, oder laden Sie ihn als UTF-8-Textdatei herunter, die Sie durchsuchen, bearbeiten oder anderswo einfügen können.
Ein Beispiel mit Zahlen
Ein dreiseitiger Mietvertrag, mietvertrag.pdf: Die Seiten 1 und 2 wurden in einer Textverarbeitung geschrieben, Seite 3 ist eine eingescannte Unterschriftenseite. Die Extraktion ergibt mietvertrag.txt. Darin folgen auf --- Page 1 --- und --- Page 2 --- deren Absätze, auf --- Page 3 --- dagegen nichts, weil ein Scan keine Zeichen enthält.
In dieser UTF-8-Datei belegt der Name der Mieterin, „Müller“, 7 Byte: je eines für M, l, l, e und r und zwei für das ü.
Was es kann und wo die Grenzen liegen
- Liest nur eine vorhandene Textebene. Schicken Sie Scans zuerst durch PDF OCR und extrahieren Sie danach.
- Erfasst immer das ganze PDF, eine Datei je Durchgang; ein einzelnes Kapitel lösen Sie vorher mit PDF-Seiten extrahieren heraus.
- Der Text folgt der in der Datei gespeicherten Reihenfolge, zweispaltige Seiten und Randspalten können daher durcheinandergeraten.
- Schriften, Bilder und Tabellenzellen fallen weg; für Überschriften und Listen nehmen Sie PDF in Markdown.
Quellen
- PDF.js Mozilla
- RFC 3629: UTF-8, a transformation format of ISO 10646 RFC Editor
Links geprüft am 10. Oktober 2026.
Mehr über „PDF in Text“
Die meisten PDFs, die aus einer Textverarbeitung, einer Webseite oder einer Tabellenkalkulation entstanden sind, enthalten echten Text: Zeichen mit ihren Positionen, gespeichert neben dem sichtbaren Layout. Dieses Werkzeug liest diese Textebene mit pdf.js, der quelloffenen PDF-Bibliothek von Mozilla, und gibt sie Ihnen als reinen Text zurück. Sie erhalten eine Vorschau auf dem Bildschirm mit der Schaltfläche Text kopieren und können alles als UTF-8-.txt-Datei speichern, die sich in jedem Texteditor öffnen lässt.
Vor den Text jeder Seite setzt die Ausgabe eine Markierungszeile wie --- Page 3 ---. So sehen Sie, woher eine Passage stammt, oder können Seiten löschen, die Sie nicht brauchen. Weil die Datei UTF-8 ist, kommen Umlaute und Akzente, Griechisch, Kyrillisch, Chinesisch, Japanisch und andere Schriften unversehrt an, sofern das PDF sie als echte Zeichen speichert. Dokumenteigenschaften wie Titel und Autor sind nicht enthalten, nur der Text der Seiten.
Gescannte PDFs bleiben leer
Ein PDF aus einem Scanner oder einer Smartphone-Kamera ist meist nur ein Stapel von Seitenfotos. Darin stecken keine Zeichen, die sich extrahieren ließen, und das Ergebnis ist leer. Um Text aus Bildern zu lesen, braucht es OCR (optische Zeichenerkennung). Dieses Werkzeug kann das nicht selbst, aber PDF OCR auf dieser Website kann es, ebenfalls in Ihrem Browser. Ein schneller Test vorab: Öffnen Sie das PDF in einem beliebigen Viewer und versuchen Sie, ein Wort zu markieren. Rastet die Markierung an den Buchstaben ein, ist die Textebene vorhanden.
Typische Anwendungsfälle
Eine Passage zitieren, ohne sie abzutippen
Sie brauchen einen Absatz aus einem Vertrag, einer Studie oder einem Benutzerhandbuch für eine E-Mail oder einen Bericht? Extrahieren Sie den Text, finden Sie die richtige Seite über ihre Markierung und fügen Sie nur den Teil ein, den Sie brauchen.
Lange Dokumente durchsuchen oder vergleichen
Eine .txt-Datei lässt sich in jedem Editor durchsuchen, mit einem Diff-Werkzeug Zeile für Zeile mit einem früheren Entwurf vergleichen oder zum Zählen und Sortieren in eine Tabellenkalkulation oder ein Skript laden.
Die Wörter an eine andere App weitergeben
Übersetzungsprogramme, Notiz-Apps und Chat-Assistenten nehmen reinen Text bereitwilliger an als ein PDF. Wenn Sie den extrahierten Text einfügen, teilen Sie nur die Passage, die Sie auswählen, statt die ganze Originaldatei hochzuladen.
Lesereihenfolge und Layout
Der Text kommt in der Reihenfolge heraus, in der er im PDF gespeichert ist. Meist, aber nicht immer, entspricht das der Reihenfolge, in der ein Mensch ihn lesen würde. Einspaltige Dokumente wie Briefe, Berichte und die meisten E-Books lassen sich sauber extrahieren. Layouts mit zwei oder drei Spalten, Randspalten, Bildunterschriften oder frei platzierten Textfeldern können durcheinandergeraten: eine Zeile aus der linken Spalte, gefolgt von einer aus der rechten, oder eine Bildunterschrift mitten in einem Absatz.
Formatierung gehört nicht zu reinem Text. Fett, kursiv, Schriftgrößen, Farben und Bilder fallen weg, und Tabellen werden zu Wortfolgen, die durch Leerzeichen oder Zeilenumbrüche getrennt sind, statt zu ordentlichen Zellen. Kommt es mehr auf das Aussehen der Seite an als auf die Zeichen, hält ein Bild aus PDF in PNG das Layout exakt fest, allerdings als Pixel.
Warum es keine Auflösungseinstellung gibt
Die Werkzeuge auf pd00, die Seiten in Bilder umwandeln, fragen nach 72, 150 oder 300 DPI, weil sie jede Seite als Pixelraster zeichnen. Die Textextraktion zeichnet überhaupt nichts. Sie liest die gespeicherten Zeichen direkt aus, deshalb gibt es keine Auflösung zu wählen und keinen Qualitätsverlust: Sie erhalten genau den Text, den das PDF enthält. Die Ergebnisdatei ist außerdem leicht, denn eine .txt enthält nur Zeichen, keine Schriften und keine Bilder, und ist oft weit kleiner als das PDF, aus dem sie stammt.
Wenn die Ausgabe nicht stimmt
- Es kommt nichts heraus. Das PDF ist ein Scan oder ein Bildexport. Hier hilft nur OCR. Schicken Sie die Datei zuerst durch PDF OCR, das eine unsichtbare Textebene hinzufügt, und extrahieren Sie den Text dann mit diesem Werkzeug.
- Seltsame Symbole statt Wörtern. Manche PDFs betten Schriften ein, ohne eine Zuordnung von den gezeichneten Formen zurück zu echten Zeichen. Die Seite sieht am Bildschirm gut aus, aber die gespeicherten Codes ergeben außerhalb dieser Schrift keinen Sinn, und die Wörter lassen sich nur per OCR zurückgewinnen.
- Wörter zerfallen oder kleben zusammen. PDFs platzieren Text in Fragmenten nach Position, daher können Leerzeichen zu viel sein oder fehlen, besonders in Blocksatz-Absätzen oder gesperrt gesetzten Überschriften.
- Die Datei ist gesperrt. Entfernen Sie das Passwort mit PDF-Passwort entfernen (Sie müssen es kennen) und extrahieren Sie dann.
Sie brauchen nur einen Teil des Dokuments?
Das Textwerkzeug arbeitet immer mit der ganzen Datei. Wollen Sie aus einem 400-seitigen Handbuch nur ein Kapitel, schneiden Sie es zuerst mit PDF-Seiten extrahieren oder PDF trennen heraus und schicken dann das kürzere PDF hier durch.
Ihr Text bleibt privat
Das PDF wird in Ihrem Browser-Tab ausgewertet, und der Text entsteht auf Ihrem Gerät; weder die Datei noch die extrahierten Wörter werden irgendwohin hochgeladen. Das zählt bei Verträgen, Arztbriefen und anderen vertraulichen Unterlagen. Mit den Schritten auf der Datenschutzseite können Sie es bestätigen.