Zum Inhalt springen

↑ ↓ wechseln · Enter öffnen · Esc schließen

Gescanntes PDF mit OCR durchsuchbar machen

Geben Sie einem gescannten PDF eine unsichtbare Ebene aus echtem Text, damit Sie seine Wörter suchen, markieren und kopieren können. Die Texterkennung läuft auf Ihrem eigenen Gerät, und jede Seite behält genau ihr Aussehen.

Läuft auf Ihrem Gerät – Dateien werden nie hochgeladen. So prüfen Sie das

Ein PDF hierher ziehen oder Dateien auswählen Jeweils ein PDF
Textsprache (bis zu 3)

Kurz gesagt

OCR verwandelt das Bild jedes Buchstabens in einem Scan in echten Text, und durchsuchbaren Text bevorzugt die Library of Congress bei den PDFs, die sie für die Langzeitarchivierung aufbewahrt. pd00 rendert jede Seite mit 300 DPI, liest sie mit der LSTM-Engine von Tesseract in bis zu 3 der 10 angebotenen Sprachen und legt die Wörter unsichtbar über die unveränderte Seite; dazu kommt eine Kopie als .txt-Datei.

So nutzen Sie „PDF OCR“

  1. Gescanntes PDF auswählenWählen Sie die Datei aus oder ziehen Sie sie auf das Werkzeug. Ein passwortgeschützter Scan muss vorher durch „PDF-Passwort entfernen“, und für diesen Schritt brauchen Sie das Passwort selbst.
  2. Sprachen festlegenBehalten Sie Deutsch oder wählen Sie die Sprachen, in denen das Dokument geschrieben ist, bis zu drei für Seiten, die mehrere Sprachen mischen.
  3. Erkennen lassen, dann herunterladenStarten Sie die OCR und lassen Sie den Tab geöffnet, während die Seiten abgearbeitet werden. Speichern Sie dann das durchsuchbare PDF und zusätzlich die .txt-Datei, wenn Sie nur die Wörter brauchen.

Ein Beispiel mit Zahlen

vertrag.pdf hat 10 A4-Seiten: Die Seiten 1 bis 8 sind Scans, die Seiten 9 und 10 wurden am Computer geschrieben und enthalten bereits Text. Ist Deutsch ausgewählt und Seiten mit vorhandenem Text überspringen aktiviert, werden die Seiten 1 bis 8 jeweils mit 2480 × 3507 Pixeln gerendert (210 mm ÷ 25,4 × 300 und 297 mm ÷ 25,4 × 300, auf ganze Pixel abgerundet) und von Tesseract gelesen; die Seiten 9 und 10 mit jeweils mindestens 20 Zeichen werden übersprungen.

Die Ergebniszeile meldet 8 erkannte und 2 übersprungene Seiten. Sie laden vertrag-ocr.pdf herunter, weiterhin 10 Seiten, die genau wie vorher aussehen, und vertrag-ocr.txt, in der die Abschnitte für die Seiten 9 und 10 leer bleiben, weil deren vorhandener Text nicht übernommen wird.

Was es kann und wo die Grenzen liegen

  • Wählen Sie je Durchgang 1 bis 3 der 10 Sprachen; jedes Sprachmodell wird einmal von pd00.com geladen und von Ihrem Browser zwischengespeichert.
  • Gedacht für gedruckten und getippten Text: Handschrift, Unterschriften und ausgefüllte Kästchen werden unzuverlässig oder gar nicht erkannt.
  • Mit aktiviertem Überspringen werden Seiten, die schon 20 oder mehr Zeichen enthalten, nicht gelesen, und ihr Text fehlt in der .txt-Datei.
  • Das Ergebnis ist durchsuchbar, nicht bearbeitbar: Jede Seite bleibt ein Bild mit verborgenem Text dahinter. Ein PDF je Durchgang.

Quellen

Links geprüft am 10. Oktober 2026.

Mehr über „PDF OCR“

Ein Scanner oder eine Scan-App auf dem Smartphone speichert jedes Blatt als Bild. Ein PDF-Viewer sieht nur Pixel: Die Suche nach einem Namen findet nichts, und wer den Cursor zieht, markiert die ganze Seite statt eines Satzes. Die optische Zeichenerkennung (OCR, auch Texterkennung genannt) untersucht diese Pixel und ermittelt, welche Buchstaben sie zeigen.

Auf dieser Seite wird jede Seite Ihrer Datei mit pdf.js in 300 DPI gezeichnet und an Tesseract übergeben, die Open-Source-Engine für OCR, und zwar in ihrer Browserfassung tesseract.js (Lizenz Apache-2.0). Die erkannten Wörter werden als unsichtbare Textebene zurück ins PDF geschrieben, genau über den passenden Stellen der Originalseite. Die sichtbare Seite bleibt unberührt: Der Scan mit seinen Farben, Stempeln und Unterschriften sieht aus wie zuvor. Neu ist, dass das Dokument jetzt auf eine Suche antwortet und Sie darin markieren und kopieren können wie in jedem am Computer erstellten PDF. Wenn Sie nur die Wörter brauchen, gibt es alles Erkannte zusätzlich als einfache .txt-Datei.

Erkennungssprachen

Tesseract liest genauer, wenn es weiß, welche Sprache zu erwarten ist. Deutsch ist voreingestellt. Außerdem stehen Englisch, Spanisch, Französisch, Portugiesisch, Italienisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Japanisch und Koreanisch zur Verfügung. Jedes Sprachmodell ist ein Download von etwa 0,7 bis 3 MB von pd00.com, wenn Sie es zum ersten Mal wählen; Ihr Browser speichert es für spätere Durchgänge zwischen.

Typische Anwendungsfälle

  • Eine Klausel in einem unterschriebenen Vertrag finden

    Ein unterschriebener Vertrag kam als Scan zurück. Nach der OCR springt die Suche nach dem Namen einer Vertragspartei oder nach dem Wort „Kündigung“ direkt zum richtigen Absatz, statt dass Sie Dutzende Bilder durchblättern.

  • Papierunterlagen, die Sie noch in Jahren finden wollen

    Rechnungen, Garantiekarten und Briefe, die Sie zur Aufbewahrung eingescannt haben, lassen sich über ihren Inhalt finden und nicht nur über den Dateinamen, sobald jede eine Textebene hat, die die Dateisuche Ihres Computers indexieren kann.

  • Aus einem kopierten Kapitel zitieren

    Ein gescanntes Buchkapitel oder ein Zeitschriftenartikel aus einem Seminarreader lässt sich nicht zitieren, ohne ihn abzutippen. Mit OCR markieren und kopieren Sie die Passage und vergleichen sie dann mit dem Seitenbild, um falsch gelesene Zeichen zu finden.

Wovon die Genauigkeit des Texts abhängt

OCR kann nur lesen, was der Scan zeigt; die Vorlage zählt also mehr als jede Einstellung. Am besten gelingt es mit Seiten, die mit 300 DPI erfasst wurden, gerade liegen und dunkle Schrift auf hellem Grund zeigen. Folgendes verschlechtert die Genauigkeit:

  • Geringe Auflösung oder Unschärfe. Das Rendern mit 300 DPI kann keine Details zurückholen, die ein niedrig aufgelöster Scan nie erfasst hat, und kleine Schrift in einem verwackelten Smartphone-Foto hat zu wenige Pixel je Buchstabe.
  • Schiefe oder seitlich liegende Seiten. Schräge Zeilen und die Wölbung nahe dem Buchrücken reißen Wörter auseinander. Drehen Sie seitlich liegende Seiten vorher mit PDF drehen aufrecht.
  • Handschrift. Tesseract ist für gedruckten und getippten Text gebaut. Handschriftliche Notizen, Unterschriften und ausgefüllte Kästchen werden nicht zuverlässig erkannt.
  • Eine fehlende Sprache. Ein deutscher Brief, der nur mit Englisch gelesen wird, verliert meist seine Umlaute und verkennt Wörter. Wählen Sie also jede Sprache aus, die auf den Seiten vorkommt.

Auch ein sauberer Scan enthält den einen oder anderen Fehler, etwa eine 1, die als l gelesen wird, oder rn, das als m erkannt wird. Die Suche findet trotzdem die meisten Wörter, aber lesen Sie alles Korrektur, was Sie in ein wichtiges Dokument übernehmen.

Wie lange die Erkennung dauert

Rechnen Sie auf einem Laptop mit mehreren Sekunden je Seite und auf einem Smartphone mit mehr. Ein zweiseitiger Brief ist schnell erledigt, ein langer Bericht kann Minuten dauern, und der Tab muss bis zum Ende geöffnet bleiben. Lange Dateien bearbeiten Sie besser am Computer. Brauchen Sie nur einen Teil eines großen Scans, lösen Sie diese Seiten mit PDF-Seiten extrahieren heraus und lassen die OCR über die kürzere Datei laufen.

Das Überspringen von Seiten mit vorhandenem Text ist standardmäßig aktiviert und spart bei gemischten Dokumenten Zeit, etwa bei einem getippten Bericht mit eingescannten Unterschriftsseiten am Ende: Erkannt werden nur Seiten ohne Text. Schalten Sie die Option aus, wenn jede Seite gelesen werden soll.

Was die durchsuchbare Kopie beibehält

Auf der sichtbaren Seite wird nichts bereinigt, begradigt oder hinzugefügt. Das Ergebnis sieht am Bildschirm und auf Papier also genauso aus wie der Scan, den Sie hinzugefügt haben. Der zusätzliche Text ist neben diesen Bildern winzig, die Datei wächst daher meist nur ein wenig. Soll das PDF auch kleiner werden, lassen Sie es in einem eigenen Schritt durch PDF verkleinern laufen; einen klaren Titel für Ihr Archiv vergeben Sie mit PDF-Metadaten bearbeiten.

Dateien, die keine OCR brauchen

  • PDFs, die schon markierbaren Text haben. Können Sie in Ihrem Viewer Wörter markieren, lassen Sie die OCR weg und kopieren die Wörter mit PDF in Text, oder Sie behalten Überschriften und Listen mit PDF in Markdown.
  • Dokumente, die Sie bearbeiten wollen. OCR macht einen Scan durchsuchbar, nicht bearbeitbar. Jede Seite bleibt ein Bild mit Text dahinter; einen Satz können Sie also nicht direkt an Ort und Stelle umschreiben.

Die Seiten werden in diesem Browser-Tab gerendert und gelesen. Zusätzlich geladen werden nur die Sprachmodelle, und zwar von pd00.com; weder Ihr Scan noch sein Text wird irgendwohin geschickt. So prüfen Sie das.

Fragen und Antworten

Wie mache ich ein gescanntes PDF durchsuchbar?

Fügen Sie das PDF hier hinzu, wählen Sie die Sprache, in der es geschrieben ist, und starten Sie die OCR. Das heruntergeladene PDF enthält eine unsichtbare Textebene, sodass Strg+F (auf dem Mac Cmd+F) Wörter auf den gescannten Seiten findet.

Verändert OCR das Aussehen meiner Seiten?

Nein. Die erkannten Wörter liegen unsichtbar über jedem Bild der Originalseite, das Dokument sieht also in jedem Viewer gleich aus.

Kann ich ein gescanntes PDF in Text umwandeln?

Ja. Zusätzlich zum durchsuchbaren PDF bietet das Werkzeug die erkannten Wörter als .txt-Datei an. Prüfen Sie Namen, Zahlen und Beträge anhand des Scans, denn OCR kann Zeichen falsch lesen.

Welche Sprachen werden erkannt?

Deutsch, Englisch, Spanisch, Französisch, Portugiesisch, Italienisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Japanisch und Koreanisch. Bis zu drei lassen sich kombinieren. Jedes Sprachmodell wird einmal von pd00.com geladen und von Ihrem Browser zwischengespeichert.

Kann das Werkzeug Handschrift lesen?

Nicht zuverlässig. Tesseract ist für gedruckten und getippten Text ausgelegt, handschriftliche Wörter werden daher oft falsch gelesen oder übersehen.

Wird mein Scan zur Erkennung auf einen Server hochgeladen?

Nein. Tesseract läuft in Ihrem Browser-Tab, und das PDF bleibt auf Ihrem Gerät; geladen werden nur die Sprachmodelle, von pd00.com. So überprüfen Sie das.

Zuletzt aktualisiert am