Aller au contenu

↑ ↓ pour naviguer · Entrée pour ouvrir · Échap pour fermer

Reconnaissance de texte (OCR) sur un PDF scanné

Ajoutez à un PDF scanné une couche invisible de vrai texte pour pouvoir y chercher, sélectionner et copier des mots. La reconnaissance s’exécute sur votre propre appareil, et chaque page garde exactement son apparence.

Tout se passe sur votre appareil : aucun fichier n’est envoyé. Comment le vérifier

Déposez un PDF ici ou choisissez des fichiers Un PDF à la fois
Langues du texte (jusqu’à 3)

En bref

L’OCR (reconnaissance optique de caractères) transforme l’image de chaque lettre d’un scan en vrai texte, et c’est un texte consultable par recherche que la Bibliothèque du Congrès des États-Unis préfère trouver dans les PDF qu’elle conserve. pd00 rend chaque page à 300 DPI, la lit avec le moteur LSTM de Tesseract en utilisant jusqu’à 3 des 10 langues proposées par pd00, et pose les mots de façon invisible sur la page inchangée, avec en plus une copie .txt.

Mode d’emploi : OCR PDF

  1. Choisissez le PDF scannéSélectionnez le fichier ou déposez-le sur l’outil. Un scan protégé par mot de passe doit d’abord passer par Déverrouiller un PDF, et cette étape demande le mot de passe lui-même.
  2. Indiquez les langues à lireGardez le français ou sélectionnez les langues dans lesquelles le document est rédigé, jusqu’à trois pour les pages qui les mélangent.
  3. Lancez la reconnaissance, puis téléchargezDémarrez l’OCR et laissez l’onglet ouvert pendant qu’il parcourt les pages. Enregistrez ensuite le PDF consultable, ainsi que le fichier .txt si vous voulez seulement les mots.

Un exemple concret

contrat.pdf compte 10 pages A4 : les pages 1 à 8 sont des scans, tandis que les pages 9 et 10 ont été tapées à l’ordinateur et contiennent déjà du texte. Avec le français sélectionné et l’option Ignorer les pages qui contiennent déjà du texte laissée active, les pages 1 à 8 sont rendues chacune à environ 2480 × 3508 pixels (21 cm ÷ 2,54 × 300 ≈ 2480 ; 29,7 cm ÷ 2,54 × 300 ≈ 3508) et lues par Tesseract ; les pages 9 et 10, qui contiennent chacune au moins 20 caractères, sont ignorées.

La ligne de résultat indique 8 pages reconnues et 2 ignorées. Vous téléchargez contrat-ocr.pdf, toujours 10 pages à l’aspect identique, et contrat-ocr.txt, dans lequel les repères des pages 9 et 10 restent vides, car leur texte existant n’y est pas recopié.

Ce que fait l’outil, et ses limites

  • Choisissez de 1 à 3 des 10 langues par opération ; chaque modèle se télécharge une fois depuis pd00.com, puis votre navigateur le garde en cache.
  • Conçu pour le texte imprimé ou dactylographié : l’écriture manuscrite, les signatures et les cases remplies à la main sont mal lues, voire pas du tout.
  • Quand l’option qui ignore les pages avec du texte est active, les pages qui contiennent déjà 20 caractères ou plus ne sont pas lues, et leur texte ne figure pas dans le fichier .txt.
  • Le résultat est consultable, pas modifiable : chaque page reste une image avec du texte caché derrière. Un seul PDF par opération.

Sources

Liens vérifiés le 10 octobre 2026.

OCR PDF : ce qu’il faut savoir

Un scanner ou une application de numérisation sur téléphone enregistre chaque feuille comme une image. Un lecteur PDF n’y voit que des pixels : une recherche sur un nom ne trouve rien, et faire glisser le curseur sélectionne toute la page au lieu d’une phrase. La reconnaissance optique de caractères (OCR) analyse ces pixels et détermine quelles lettres ils représentent.

Sur cette page, chaque page de votre fichier est dessinée à 300 DPI avec pdf.js, puis confiée à Tesseract, le moteur d’OCR open source, dans sa version pour navigateur, tesseract.js (licence Apache-2.0). Les mots reconnus sont réécrits dans le PDF sous forme de couche de texte invisible, placée sur les zones correspondantes de la page d’origine. La page visible n’est pas modifiée : le scan, ses couleurs, ses tampons et ses signatures restent identiques. Ce qui change, c’est que le document répond désormais à une recherche, et que vous pouvez y surligner et copier du texte comme dans n’importe quel PDF créé sur ordinateur. Si seuls les mots vous intéressent, tout le texte reconnu est aussi proposé dans un simple fichier .txt.

Langues de reconnaissance

Tesseract lit plus précisément quand il sait quelle langue attendre. Sur cette version de la page, le français est sélectionné par défaut. L’anglais, l’espagnol, l’allemand, le portugais, l’italien, le chinois (simplifié), le chinois (traditionnel), le japonais et le coréen sont également disponibles. Chaque modèle de langue représente un téléchargement d’environ 0,7 à 3 Mo depuis pd00.com la première fois que vous le choisissez ; votre navigateur le garde ensuite en cache pour les fois suivantes.

Dans quels cas l’utiliser

  • Retrouver une clause dans un contrat signé

    Un contrat signé vous est revenu sous forme de scan. Après l’OCR, une recherche sur le nom d’une partie ou sur le mot « résiliation » mène directement au bon paragraphe, au lieu de vous obliger à feuilleter des dizaines d’images.

  • Des archives papier à retrouver des années plus tard

    Factures, bons de garantie et courriers scannés pour être conservés se retrouvent par leur contenu, et pas seulement par leur nom de fichier, dès que chacun porte une couche de texte que la recherche de fichiers de votre ordinateur peut indexer.

  • Citer un chapitre photocopié

    Un chapitre de livre ou un article de revue scanné dans un recueil de cours ne peut pas être cité sans être retapé. Avec l’OCR, vous sélectionnez le passage, le copiez, puis le comparez à l’image de la page pour repérer les caractères mal lus.

Ce qui détermine la précision du texte

L’OCR ne peut lire que ce que montre le scan : la source compte davantage que n’importe quel réglage. Les meilleurs résultats viennent de pages numérisées à 300 DPI, bien droites, avec une impression foncée sur fond clair. La précision baisse avec :

  • Une basse résolution ou un flou. Le rendu à 300 DPI ne peut pas restituer des détails qu’un scan en basse résolution n’a jamais capturés, et les petits caractères d’une photo de téléphone prise à main levée ont trop peu de pixels par lettre.
  • Des pages de travers ou couchées. Les lignes inclinées et la courbure près de la reliure d’un livre déforment les mots. Redressez les pages couchées avec Pivoter un PDF avant de commencer.
  • L’écriture manuscrite. Tesseract est conçu pour le texte imprimé ou dactylographié. Les notes manuscrites, les signatures et les cases remplies à la main ne sont pas reconnues de façon fiable.
  • Une langue manquante. Une lettre en allemand lue avec le français seul perd souvent ses trémas et se trompe sur des mots : sélectionnez toutes les langues présentes dans les pages.

Même un scan propre contiendra quelques erreurs, comme un 1 lu comme un l, ou « rn » lu comme « m ». La recherche trouve tout de même la plupart des mots, mais relisez tout ce que vous copiez dans un document important.

Combien de temps prend la reconnaissance

Comptez plusieurs secondes par page sur un ordinateur portable, et davantage sur un téléphone ; une lettre de deux pages est vite traitée, alors qu’un long rapport peut prendre plusieurs minutes, et l’onglet doit rester ouvert jusqu’à la fin. Les longs fichiers se traitent mieux sur un ordinateur. Si vous n’avez besoin que d’une partie d’un gros scan, sortez ces pages avec Extraire des pages et lancez l’OCR sur le fichier plus court.

L’option qui ignore les pages contenant déjà du texte est active par défaut et fait gagner du temps sur les documents mixtes, comme un rapport tapé à l’ordinateur suivi de pages de signature scannées : seules les pages sans texte sont reconnues. Désactivez-la pour faire lire toutes les pages.

Ce que conserve la copie consultable

Rien n’est nettoyé, redressé ni ajouté sur la page visible : le résultat a le même aspect, à l’écran comme sur papier, que le scan que vous avez ajouté. Le texte ajouté pèse très peu à côté des images, si bien que le fichier ne grossit en général que légèrement. Si vous voulez aussi un PDF plus léger, passez-le par Compresser un PDF dans une étape séparée ; pour lui donner un titre clair dans vos archives, indiquez-en un avec Métadonnées PDF.

Les fichiers qui n’ont pas besoin d’OCR

  • Les PDF qui ont déjà du texte sélectionnable. Si vous pouvez surligner des mots dans votre lecteur, inutile de lancer l’OCR : copiez le texte avec PDF en texte, ou gardez les titres et les listes avec PDF en Markdown.
  • Les documents que vous voulez modifier. L’OCR rend un scan consultable, pas modifiable. Chaque page reste une image avec du texte derrière : vous ne pouvez pas retaper une phrase sur place.

Les pages sont rendues et lues dans cet onglet du navigateur. Les seuls téléchargements supplémentaires sont les modèles de langue, récupérés depuis pd00.com, et ni votre scan ni son texte ne sont envoyés nulle part ; voici comment le vérifier.

Questions fréquentes

Comment rendre un PDF scanné consultable ?

Ajoutez le PDF ici, sélectionnez la langue dans laquelle il est rédigé et lancez l’OCR. Le PDF téléchargé contient une couche de texte invisible : Ctrl+F (Cmd+F sur Mac) trouve alors les mots des pages scannées.

L’OCR change-t-il l’apparence de mes pages ?

Non. Les mots reconnus sont posés de façon invisible sur l’image de chaque page d’origine : le document a exactement le même aspect dans n’importe quel lecteur.

Puis-je convertir un PDF scanné en texte ?

Oui. En plus du PDF consultable, l’outil propose les mots reconnus dans un fichier .txt. Vérifiez les noms, les chiffres et les montants par rapport au scan, car l’OCR peut mal lire certains caractères.

Quelles langues peut-il reconnaître ?

Le français, l’anglais, l’espagnol, l’allemand, le portugais, l’italien, le chinois (simplifié), le chinois (traditionnel), le japonais et le coréen. Vous pouvez en combiner jusqu’à trois. Chaque modèle de langue se télécharge une fois depuis pd00.com, puis votre navigateur le garde en cache.

Peut-il lire l’écriture manuscrite ?

Pas de façon fiable. Tesseract est conçu pour le texte imprimé ou dactylographié : les mots manuscrits sont souvent mal lus ou manqués.

Mon scan est-il envoyé sur un serveur pour la reconnaissance ?

Non. Tesseract s’exécute dans l’onglet de votre navigateur et le PDF reste sur votre appareil ; seuls les modèles de langue sont téléchargés, depuis pd00.com. Voyez comment le vérifier.

Dernière mise à jour :