En bref
L’OCR (reconnaissance optique de caractères) transforme l’image de chaque lettre d’un scan en vrai texte, et c’est un texte consultable par recherche que la Bibliothèque du Congrès des États-Unis préfère trouver dans les PDF qu’elle conserve. pd00 rend chaque page à 300 DPI, la lit avec le moteur LSTM de Tesseract en utilisant jusqu’à 3 des 10 langues proposées par pd00, et pose les mots de façon invisible sur la page inchangée, avec en plus une copie .txt.
Mode d’emploi : OCR PDF
- Choisissez le PDF scannéSélectionnez le fichier ou déposez-le sur l’outil. Un scan protégé par mot de passe doit d’abord passer par Déverrouiller un PDF, et cette étape demande le mot de passe lui-même.
- Indiquez les langues à lireGardez le français ou sélectionnez les langues dans lesquelles le document est rédigé, jusqu’à trois pour les pages qui les mélangent.
- Lancez la reconnaissance, puis téléchargezDémarrez l’OCR et laissez l’onglet ouvert pendant qu’il parcourt les pages. Enregistrez ensuite le PDF consultable, ainsi que le fichier .txt si vous voulez seulement les mots.
Un exemple concret
contrat.pdf compte 10 pages A4 : les pages 1 à 8 sont des scans, tandis que les pages 9 et 10 ont été tapées à l’ordinateur et contiennent déjà du texte. Avec le français sélectionné et l’option Ignorer les pages qui contiennent déjà du texte laissée active, les pages 1 à 8 sont rendues chacune à environ 2480 × 3508 pixels (21 cm ÷ 2,54 × 300 ≈ 2480 ; 29,7 cm ÷ 2,54 × 300 ≈ 3508) et lues par Tesseract ; les pages 9 et 10, qui contiennent chacune au moins 20 caractères, sont ignorées.
La ligne de résultat indique 8 pages reconnues et 2 ignorées. Vous téléchargez contrat-ocr.pdf, toujours 10 pages à l’aspect identique, et contrat-ocr.txt, dans lequel les repères des pages 9 et 10 restent vides, car leur texte existant n’y est pas recopié.
Ce que fait l’outil, et ses limites
- Choisissez de 1 à 3 des 10 langues par opération ; chaque modèle se télécharge une fois depuis pd00.com, puis votre navigateur le garde en cache.
- Conçu pour le texte imprimé ou dactylographié : l’écriture manuscrite, les signatures et les cases remplies à la main sont mal lues, voire pas du tout.
- Quand l’option qui ignore les pages avec du texte est active, les pages qui contiennent déjà 20 caractères ou plus ne sont pas lues, et leur texte ne figure pas dans le fichier .txt.
- Le résultat est consultable, pas modifiable : chaque page reste une image avec du texte caché derrière. Un seul PDF par opération.
Sources
- Tesseract User Manual Tesseract OCR
- PDF (Portable Document Format) Family Library of Congress
- PDF.js Mozilla
- @cantoo/pdf-lib, a maintained fork of pdf-lib Cantoo on GitHub
Liens vérifiés le 10 octobre 2026.
OCR PDF : ce qu’il faut savoir
Un scanner ou une application de numérisation sur téléphone enregistre chaque feuille comme une image. Un lecteur PDF n’y voit que des pixels : une recherche sur un nom ne trouve rien, et faire glisser le curseur sélectionne toute la page au lieu d’une phrase. La reconnaissance optique de caractères (OCR) analyse ces pixels et détermine quelles lettres ils représentent.
Sur cette page, chaque page de votre fichier est dessinée à 300 DPI avec pdf.js, puis confiée à Tesseract, le moteur d’OCR open source, dans sa version pour navigateur, tesseract.js (licence Apache-2.0). Les mots reconnus sont réécrits dans le PDF sous forme de couche de texte invisible, placée sur les zones correspondantes de la page d’origine. La page visible n’est pas modifiée : le scan, ses couleurs, ses tampons et ses signatures restent identiques. Ce qui change, c’est que le document répond désormais à une recherche, et que vous pouvez y surligner et copier du texte comme dans n’importe quel PDF créé sur ordinateur. Si seuls les mots vous intéressent, tout le texte reconnu est aussi proposé dans un simple fichier .txt.
Langues de reconnaissance
Tesseract lit plus précisément quand il sait quelle langue attendre. Sur cette version de la page, le français est sélectionné par défaut. L’anglais, l’espagnol, l’allemand, le portugais, l’italien, le chinois (simplifié), le chinois (traditionnel), le japonais et le coréen sont également disponibles. Chaque modèle de langue représente un téléchargement d’environ 0,7 à 3 Mo depuis pd00.com la première fois que vous le choisissez ; votre navigateur le garde ensuite en cache pour les fois suivantes.
Dans quels cas l’utiliser
Retrouver une clause dans un contrat signé
Un contrat signé vous est revenu sous forme de scan. Après l’OCR, une recherche sur le nom d’une partie ou sur le mot « résiliation » mène directement au bon paragraphe, au lieu de vous obliger à feuilleter des dizaines d’images.
Des archives papier à retrouver des années plus tard
Factures, bons de garantie et courriers scannés pour être conservés se retrouvent par leur contenu, et pas seulement par leur nom de fichier, dès que chacun porte une couche de texte que la recherche de fichiers de votre ordinateur peut indexer.
Citer un chapitre photocopié
Un chapitre de livre ou un article de revue scanné dans un recueil de cours ne peut pas être cité sans être retapé. Avec l’OCR, vous sélectionnez le passage, le copiez, puis le comparez à l’image de la page pour repérer les caractères mal lus.
Ce qui détermine la précision du texte
L’OCR ne peut lire que ce que montre le scan : la source compte davantage que n’importe quel réglage. Les meilleurs résultats viennent de pages numérisées à 300 DPI, bien droites, avec une impression foncée sur fond clair. La précision baisse avec :
- Une basse résolution ou un flou. Le rendu à 300 DPI ne peut pas restituer des détails qu’un scan en basse résolution n’a jamais capturés, et les petits caractères d’une photo de téléphone prise à main levée ont trop peu de pixels par lettre.
- Des pages de travers ou couchées. Les lignes inclinées et la courbure près de la reliure d’un livre déforment les mots. Redressez les pages couchées avec Pivoter un PDF avant de commencer.
- L’écriture manuscrite. Tesseract est conçu pour le texte imprimé ou dactylographié. Les notes manuscrites, les signatures et les cases remplies à la main ne sont pas reconnues de façon fiable.
- Une langue manquante. Une lettre en allemand lue avec le français seul perd souvent ses trémas et se trompe sur des mots : sélectionnez toutes les langues présentes dans les pages.
Même un scan propre contiendra quelques erreurs, comme un 1 lu comme un l, ou « rn » lu comme « m ». La recherche trouve tout de même la plupart des mots, mais relisez tout ce que vous copiez dans un document important.
Combien de temps prend la reconnaissance
Comptez plusieurs secondes par page sur un ordinateur portable, et davantage sur un téléphone ; une lettre de deux pages est vite traitée, alors qu’un long rapport peut prendre plusieurs minutes, et l’onglet doit rester ouvert jusqu’à la fin. Les longs fichiers se traitent mieux sur un ordinateur. Si vous n’avez besoin que d’une partie d’un gros scan, sortez ces pages avec Extraire des pages et lancez l’OCR sur le fichier plus court.
L’option qui ignore les pages contenant déjà du texte est active par défaut et fait gagner du temps sur les documents mixtes, comme un rapport tapé à l’ordinateur suivi de pages de signature scannées : seules les pages sans texte sont reconnues. Désactivez-la pour faire lire toutes les pages.
Ce que conserve la copie consultable
Rien n’est nettoyé, redressé ni ajouté sur la page visible : le résultat a le même aspect, à l’écran comme sur papier, que le scan que vous avez ajouté. Le texte ajouté pèse très peu à côté des images, si bien que le fichier ne grossit en général que légèrement. Si vous voulez aussi un PDF plus léger, passez-le par Compresser un PDF dans une étape séparée ; pour lui donner un titre clair dans vos archives, indiquez-en un avec Métadonnées PDF.
Les fichiers qui n’ont pas besoin d’OCR
- Les PDF qui ont déjà du texte sélectionnable. Si vous pouvez surligner des mots dans votre lecteur, inutile de lancer l’OCR : copiez le texte avec PDF en texte, ou gardez les titres et les listes avec PDF en Markdown.
- Les documents que vous voulez modifier. L’OCR rend un scan consultable, pas modifiable. Chaque page reste une image avec du texte derrière : vous ne pouvez pas retaper une phrase sur place.
Les pages sont rendues et lues dans cet onglet du navigateur. Les seuls téléchargements supplémentaires sont les modèles de langue, récupérés depuis pd00.com, et ni votre scan ni son texte ne sont envoyés nulle part ; voici comment le vérifier.