# Text aus einem PDF extrahieren

Holen Sie die Wörter aus einem PDF heraus und kopieren Sie sie oder speichern Sie sie als einfache .txt-Datei. Die Extraktion läuft in Ihrem Browser, das Dokument bleibt also auf Ihrem Gerät.

## Kurz gesagt

Ein PDF, das aus einer Textverarbeitung oder von einer Webseite exportiert wurde, enthält seine Wörter als echte Zeichen; pd00 liest sie mit pdf.js und speichert eine UTF-8-`.txt`-Datei mit einer Zeile `--- Page N ---` vor jeder Seite. UTF-8 kodiert jedes Unicode-Zeichen in 1 bis 4 Byte, sodass Umlaute, Akzente, Kyrillisch und Chinesisch unversehrt ankommen. Gescannte Seiten enthalten keine Zeichen und bleiben leer.

## So nutzen Sie „PDF in Text“

1. **PDF hinzufügen**  
   Wählen Sie ein PDF von Ihrem Gerät aus oder ziehen Sie es auf das Werkzeug. Eine Datei, die nach einem Passwort fragt, muss erst entsperrt werden, bevor sich ihr Text lesen lässt.
2. **Extrahierten Text prüfen**  
   Starten Sie die Extraktion, und der Text erscheint Seite für Seite in der Vorschau, getrennt durch Zeilen wie --- Page N ---. Überfliegen Sie ihn, um sicherzugehen, dass die Lesereihenfolge stimmt.
3. **Kopieren oder als .txt speichern**  
   Klicken Sie auf „Text kopieren“, um den gesamten Text in die Zwischenablage zu legen, oder laden Sie ihn als UTF-8-Textdatei herunter, die Sie durchsuchen, bearbeiten oder anderswo einfügen können.

## Ein Beispiel mit Zahlen

Ein dreiseitiger Mietvertrag, `mietvertrag.pdf`: Die Seiten 1 und 2 wurden in einer Textverarbeitung geschrieben, Seite 3 ist eine eingescannte Unterschriftenseite. Die Extraktion ergibt `mietvertrag.txt`. Darin folgen auf `--- Page 1 ---` und `--- Page 2 ---` deren Absätze, auf `--- Page 3 ---` dagegen nichts, weil ein Scan keine Zeichen enthält.

In dieser UTF-8-Datei belegt der Name der Mieterin, „Müller“, 7 Byte: je eines für M, l, l, e und r und zwei für das ü.

## Was es kann und wo die Grenzen liegen

- Liest nur eine vorhandene Textebene. Schicken Sie Scans zuerst durch [PDF OCR](https://pd00.com/de/pdf-ocr/) und extrahieren Sie danach.
- Erfasst immer das ganze PDF, eine Datei je Durchgang; ein einzelnes Kapitel lösen Sie vorher mit [PDF-Seiten extrahieren](https://pd00.com/de/pdf-seiten-extrahieren/) heraus.
- Der Text folgt der in der Datei gespeicherten Reihenfolge, zweispaltige Seiten und Randspalten können daher durcheinandergeraten.
- Schriften, Bilder und Tabellenzellen fallen weg; für Überschriften und Listen nehmen Sie [PDF in Markdown](https://pd00.com/de/pdf-in-markdown/).

## Quellen

- [PDF.js](https://mozilla.github.io/pdf.js/), Mozilla
- [RFC 3629: UTF-8, a transformation format of ISO 10646](https://www.rfc-editor.org/rfc/rfc3629), RFC Editor

Links geprüft am 10. Oktober 2026.

## Mehr über „PDF in Text“

Die meisten PDFs, die aus einer Textverarbeitung, einer Webseite oder einer Tabellenkalkulation entstanden sind, enthalten echten Text: Zeichen mit ihren Positionen, gespeichert neben dem sichtbaren Layout. Dieses Werkzeug liest diese Textebene mit pdf.js, der quelloffenen PDF-Bibliothek von Mozilla, und gibt sie Ihnen als reinen Text zurück. Sie erhalten eine Vorschau auf dem Bildschirm mit der Schaltfläche **Text kopieren** und können alles als UTF-8-`.txt`-Datei speichern, die sich in jedem Texteditor öffnen lässt.

Vor den Text jeder Seite setzt die Ausgabe eine Markierungszeile wie `--- Page 3 ---`. So sehen Sie, woher eine Passage stammt, oder können Seiten löschen, die Sie nicht brauchen. Weil die Datei UTF-8 ist, kommen Umlaute und Akzente, Griechisch, Kyrillisch, Chinesisch, Japanisch und andere Schriften unversehrt an, sofern das PDF sie als echte Zeichen speichert. Dokumenteigenschaften wie Titel und Autor sind nicht enthalten, nur der Text der Seiten.

### Gescannte PDFs bleiben leer

Ein PDF aus einem Scanner oder einer Smartphone-Kamera ist meist nur ein Stapel von Seitenfotos. Darin stecken keine Zeichen, die sich extrahieren ließen, und das Ergebnis ist leer. Um Text aus Bildern zu lesen, braucht es OCR (optische Zeichenerkennung). Dieses Werkzeug kann das nicht selbst, aber [PDF OCR](https://pd00.com/de/pdf-ocr/) auf dieser Website kann es, ebenfalls in Ihrem Browser. Ein schneller Test vorab: Öffnen Sie das PDF in einem beliebigen Viewer und versuchen Sie, ein Wort zu markieren. Rastet die Markierung an den Buchstaben ein, ist die Textebene vorhanden.

## Typische Anwendungsfälle

### Eine Passage zitieren, ohne sie abzutippen

Sie brauchen einen Absatz aus einem Vertrag, einer Studie oder einem Benutzerhandbuch für eine E-Mail oder einen Bericht? Extrahieren Sie den Text, finden Sie die richtige Seite über ihre Markierung und fügen Sie nur den Teil ein, den Sie brauchen.

### Lange Dokumente durchsuchen oder vergleichen

Eine .txt-Datei lässt sich in jedem Editor durchsuchen, mit einem Diff-Werkzeug Zeile für Zeile mit einem früheren Entwurf vergleichen oder zum Zählen und Sortieren in eine Tabellenkalkulation oder ein Skript laden.

### Die Wörter an eine andere App weitergeben

Übersetzungsprogramme, Notiz-Apps und Chat-Assistenten nehmen reinen Text bereitwilliger an als ein PDF. Wenn Sie den extrahierten Text einfügen, teilen Sie nur die Passage, die Sie auswählen, statt die ganze Originaldatei hochzuladen.

## Lesereihenfolge und Layout

Der Text kommt in der Reihenfolge heraus, in der er im PDF gespeichert ist. Meist, aber nicht immer, entspricht das der Reihenfolge, in der ein Mensch ihn lesen würde. Einspaltige Dokumente wie Briefe, Berichte und die meisten E-Books lassen sich sauber extrahieren. Layouts mit zwei oder drei Spalten, Randspalten, Bildunterschriften oder frei platzierten Textfeldern können durcheinandergeraten: eine Zeile aus der linken Spalte, gefolgt von einer aus der rechten, oder eine Bildunterschrift mitten in einem Absatz.

Formatierung gehört nicht zu reinem Text. Fett, kursiv, Schriftgrößen, Farben und Bilder fallen weg, und Tabellen werden zu Wortfolgen, die durch Leerzeichen oder Zeilenumbrüche getrennt sind, statt zu ordentlichen Zellen. Kommt es mehr auf das Aussehen der Seite an als auf die Zeichen, hält ein Bild aus [PDF in PNG](https://pd00.com/de/pdf-in-png/) das Layout exakt fest, allerdings als Pixel.

## Warum es keine Auflösungseinstellung gibt

Die Werkzeuge auf pd00, die Seiten in Bilder umwandeln, fragen nach 72, 150 oder 300 DPI, weil sie jede Seite als Pixelraster zeichnen. Die Textextraktion zeichnet überhaupt nichts. Sie liest die gespeicherten Zeichen direkt aus, deshalb gibt es keine Auflösung zu wählen und keinen Qualitätsverlust: Sie erhalten genau den Text, den das PDF enthält. Die Ergebnisdatei ist außerdem leicht, denn eine .txt enthält nur Zeichen, keine Schriften und keine Bilder, und ist oft weit kleiner als das PDF, aus dem sie stammt.

## Wenn die Ausgabe nicht stimmt

- **Es kommt nichts heraus.** Das PDF ist ein Scan oder ein Bildexport. Hier hilft nur OCR. Schicken Sie die Datei zuerst durch [PDF OCR](https://pd00.com/de/pdf-ocr/), das eine unsichtbare Textebene hinzufügt, und extrahieren Sie den Text dann mit diesem Werkzeug.
- **Seltsame Symbole statt Wörtern.** Manche PDFs betten Schriften ein, ohne eine Zuordnung von den gezeichneten Formen zurück zu echten Zeichen. Die Seite sieht am Bildschirm gut aus, aber die gespeicherten Codes ergeben außerhalb dieser Schrift keinen Sinn, und die Wörter lassen sich nur per OCR zurückgewinnen.
- **Wörter zerfallen oder kleben zusammen.** PDFs platzieren Text in Fragmenten nach Position, daher können Leerzeichen zu viel sein oder fehlen, besonders in Blocksatz-Absätzen oder gesperrt gesetzten Überschriften.
- **Die Datei ist gesperrt.** Entfernen Sie das Passwort mit [PDF-Passwort entfernen](https://pd00.com/de/pdf-passwort-entfernen/) (Sie müssen es kennen) und extrahieren Sie dann.

## Sie brauchen nur einen Teil des Dokuments?

Das Textwerkzeug arbeitet immer mit der ganzen Datei. Wollen Sie aus einem 400-seitigen Handbuch nur ein Kapitel, schneiden Sie es zuerst mit [PDF-Seiten extrahieren](https://pd00.com/de/pdf-seiten-extrahieren/) oder [PDF trennen](https://pd00.com/de/pdf-trennen/) heraus und schicken dann das kürzere PDF hier durch.

## Ihr Text bleibt privat

Das PDF wird in Ihrem Browser-Tab ausgewertet, und der Text entsteht auf Ihrem Gerät; weder die Datei noch die extrahierten Wörter werden irgendwohin hochgeladen. Das zählt bei Verträgen, Arztbriefen und anderen vertraulichen Unterlagen. Mit den Schritten auf der [Datenschutzseite](https://pd00.com/de/datenschutz/#verify) können Sie es bestätigen.

## Fragen und Antworten

### Wie kopiere ich den gesamten Text aus einem PDF?

Fügen Sie das PDF hier hinzu und klicken Sie auf **Text kopieren**, sobald der Text erschienen ist. Alles landet in Ihrer Zwischenablage, die Seitenmarkierungen eingeschlossen.

### Warum ist der extrahierte Text leer?

Das PDF hat so gut wie sicher keine Textebene, wie es bei Scans und abfotografierten Seiten üblich ist. Versuchen Sie, in Ihrem PDF-Viewer ein Wort zu markieren: Wird nichts ausgewählt, gibt es keinen Text zum Extrahieren. Fügen Sie mit dem Werkzeug „PDF OCR“ zuerst eine durchsuchbare Textebene hinzu und kommen Sie dann hierher zurück.

### Warum sind die beiden Spalten vermischt?

Das Werkzeug folgt der Reihenfolge, in der der Text in der Datei gespeichert ist. In mehrspaltigen Layouts kann diese Reihenfolge zwischen den Spalten springen, sodass sich Zeilen aus verschiedenen Spalten abwechseln.

### Bleiben Tabellen, Bilder und Formatierung erhalten?

Nein. Eine `.txt`-Datei enthält nur Zeichen, Formatierung und Bilder fallen also weg, und Tabellenzellen werden zu Wörtern, die durch Leerzeichen oder Zeilenumbrüche getrennt sind.

### Wozu dienen die Zeilen „--- Page N ---“?

Sie markieren, wo jede Seite beginnt, und helfen Ihnen, ein Zitat seiner Seite zuzuordnen. Brauchen Sie sie nicht, entfernen Sie sie mit der Suchen-und-Ersetzen-Funktion Ihres Editors.

### Kommt das Werkzeug mit Text in anderen Sprachen zurecht?

Ja, solange das PDF ordentliche Unicode-Zeichen speichert. Die Ausgabe ist UTF-8 und deckt damit alle großen Schriftsysteme ab, von Umlauten und Akzenten bis zu Chinesisch und Japanisch.

### Wird mein Dokument beim Extrahieren hochgeladen?

Nein. Die Extraktion läuft vollständig in Ihrem Browser, und der Text verlässt Ihr Gerät nur, wenn Sie ihn selbst irgendwo einfügen. [So überprüfen Sie das](https://pd00.com/de/datenschutz/#verify).

Zuletzt aktualisiert am 11. Oktober 2026  
https://pd00.com/de/pdf-in-text/
