Aller au contenu

↑ ↓ pour naviguer · Entrée pour ouvrir · Échap pour fermer

Extraire le texte d’un PDF

Récupérez les mots d’un PDF, puis copiez-les ou enregistrez-les dans un simple fichier .txt. L’extraction se fait dans votre navigateur : le document reste sur votre appareil.

Tout se passe sur votre appareil : aucun fichier n’est envoyé. Comment le vérifier

Déposez un PDF ici ou choisissez des fichiers Un PDF à la fois

En bref

Un PDF exporté depuis un traitement de texte ou une page web garde ses mots sous forme de vrais caractères : pd00 les lit avec pdf.js et enregistre un fichier .txt en UTF-8, avec une ligne --- Page N --- avant chaque page. L’UTF-8 encode n’importe quel caractère Unicode sur 1 à 4 octets, si bien que les accents, le cyrillique et le chinois passent sans dommage. Les pages scannées ne contiennent aucun caractère et sortent vides.

Mode d’emploi : PDF en texte

  1. Ajoutez votre PDFChoisissez un PDF sur votre appareil ou faites-le glisser sur l’outil. Un fichier qui demande un mot de passe doit être déverrouillé avant que son texte puisse être lu.
  2. Vérifiez le texte extraitLancez l’extraction : le texte apparaît dans l’aperçu, page par page, séparé par des lignes --- Page N ---. Parcourez-le pour vérifier que l’ordre de lecture tient la route.
  3. Copiez-le ou enregistrez un fichier .txtAppuyez sur « Copier le texte » pour tout mettre dans le presse-papiers, ou téléchargez-le sous forme de fichier texte UTF-8 que vous pourrez fouiller, modifier ou coller ailleurs.

Un exemple concret

Un bail de 3 pages, bail.pdf : les pages 1 et 2 ont été tapées dans un traitement de texte, et la page 3 est une page de signatures scannée. L’extraction donne bail.txt, où --- Page 1 --- et --- Page 2 --- sont suivies de leurs paragraphes, et --- Page 3 --- de rien du tout, car un scan ne contient aucun caractère.

Dans ce fichier UTF-8, le prénom de la locataire, « Hélène », occupe 8 octets : un chacun pour H, l, n et le e final, et deux chacun pour le é et le è (4 + 4 = 8).

Ce que fait l’outil, et ses limites

  • Ne lit qu’une couche de texte existante. Passez d’abord les scans dans OCR PDF, puis lancez l’extraction.
  • Couvre toujours tout le PDF, un fichier par opération ; isolez un chapitre au préalable avec Extraire des pages.
  • Le texte suit l’ordre dans lequel il est stocké dans le fichier : les pages à deux colonnes et les encadrés peuvent sortir entremêlés.
  • Les polices, les images et les cellules de tableau sont perdues ; pour les titres et les listes, utilisez PDF en Markdown.

Sources

Liens vérifiés le 10 octobre 2026.

PDF en texte : ce qu’il faut savoir

La plupart des PDF créés depuis un traitement de texte, une page web ou un tableur contiennent du vrai texte : des caractères avec leur position, stockés à côté de la mise en page visuelle. Cet outil lit cette couche de texte avec pdf.js, la bibliothèque PDF open source de Mozilla, et vous la rend sous forme de texte brut. Vous obtenez un aperçu à l’écran avec un bouton Copier le texte, et vous pouvez tout enregistrer dans un fichier .txt en UTF-8 qui s’ouvre dans n’importe quel éditeur de texte.

Avant le texte de chaque page, le résultat insère une ligne de repère comme --- Page 3 --- : vous savez ainsi d’où vient un passage, et vous pouvez supprimer les pages inutiles. Comme le fichier est en UTF-8, les lettres accentuées, le grec, le cyrillique, le chinois, le japonais et les autres écritures passent sans dommage, à condition que le PDF les stocke comme de vrais caractères. Les propriétés du document, comme le titre et l’auteur, ne sont pas incluses ; seul le texte des pages l’est.

Les PDF scannés sortent vides

Un PDF produit par un scanner ou l’appareil photo d’un téléphone n’est en général qu’une pile de photos de pages. Il n’y a aucun caractère à extraire : le résultat est vide. Lire du texte dans des images demande l’OCR (reconnaissance optique de caractères). Cet outil ne le fait pas lui-même, mais OCR PDF, sur ce site, s’en charge, lui aussi dans votre navigateur. Un test rapide avant de commencer : ouvrez le PDF dans n’importe quel lecteur PDF et essayez de surligner un mot. Si la sélection s’accroche aux lettres, la couche de texte est bien là.

Dans quels cas l’utiliser

  • Citer un passage sans le retaper

    Besoin d’un paragraphe d’un contrat, d’une étude ou d’un mode d’emploi pour un e-mail ou un rapport ? Extrayez le texte, retrouvez la bonne page grâce à son repère et collez uniquement la partie utile.

  • Rechercher dans de longs documents ou les comparer

    Un fichier .txt se fouille dans n’importe quel éditeur, se compare ligne à ligne avec une version précédente grâce à un outil de comparaison (diff), ou se charge dans un tableur ou un script pour compter et trier.

  • Confier les mots à une autre appli

    Les outils de traduction, les applis de notes et les assistants conversationnels acceptent plus volontiers du texte brut qu’un PDF. En collant le texte extrait, vous ne partagez que le passage choisi au lieu d’envoyer tout le fichier d’origine.

Ordre de lecture et mise en page

Le texte sort dans l’ordre où il est stocké dans le PDF, qui correspond généralement, mais pas toujours, à l’ordre dans lequel une personne le lirait. Les documents sur une seule colonne, comme les lettres, les rapports et la plupart des livres numériques, s’extraient proprement. Les mises en page à deux ou trois colonnes, avec encadrés, légendes ou blocs de texte flottants, peuvent s’entremêler : une ligne de la colonne de gauche suivie d’une ligne de celle de droite, ou une légende qui atterrit au milieu d’un paragraphe.

La mise en forme ne fait pas partie du texte brut. Le gras, l’italique, les tailles de police, les couleurs et les images disparaissent, et les tableaux deviennent des suites de mots séparés par des espaces ou des sauts de ligne, et non des cellules bien rangées. Quand l’aspect de la page compte plus que les caractères, une image obtenue avec PDF en PNG conserve exactement la mise en page, mais sous forme de pixels.

Pourquoi il n’y a pas de réglage de résolution

Les convertisseurs de pages en images de pd00 demandent 72, 150 ou 300 DPI, car ils dessinent chaque page sous forme de grille de pixels. L’extraction de texte ne dessine rien du tout. Elle lit directement les caractères stockés : il n’y a donc aucune résolution à choisir et aucune perte de qualité, et vous obtenez exactement le texte que contient le PDF. Le fichier obtenu est aussi léger, puisqu’un .txt ne contient que des caractères, sans polices ni images ; il est souvent bien plus petit que le PDF d’origine.

Quand le résultat semble faux

  • Rien ne sort. Le PDF est un scan ou un export d’images. Seul l’OCR peut aider ici. Passez d’abord le fichier dans OCR PDF, qui ajoute une couche de texte invisible, puis extrayez le texte avec cet outil.
  • Des symboles bizarres à la place des mots. Certains PDF incorporent des polices sans table de correspondance entre les formes dessinées et les vrais caractères. La page s’affiche bien à l’écran, mais les codes stockés n’ont aucun sens hors de cette police : les mots ne peuvent donc être récupérés que par OCR.
  • Des mots coupés ou collés. Les PDF placent le texte par fragments selon leur position : des espaces en trop ou manquants peuvent apparaître, surtout dans les paragraphes justifiés ou les titres aux lettres espacées.
  • Le fichier est verrouillé. Supprimez le mot de passe avec Déverrouiller un PDF (vous devez le connaître), puis lancez l’extraction.

Besoin d’une partie du document seulement ?

L’outil de texte traite le fichier entier. Pour un manuel de 400 pages dont vous ne voulez qu’un chapitre, découpez-le d’abord avec Extraire des pages ou Diviser un PDF, puis passez ce PDF plus court dans cet outil.

Votre texte reste privé

Le PDF est analysé dans l’onglet de votre navigateur et le texte est produit sur votre appareil ; ni le fichier ni les mots extraits ne sont envoyés où que ce soit. C’est important pour les contrats, les courriers médicaux et autres papiers confidentiels. Suivez les étapes de la page de confidentialité pour le confirmer.

Questions fréquentes

Comment copier tout le texte d’un PDF ?

Ajoutez le PDF ici et appuyez sur Copier le texte une fois le texte affiché. Tout part dans votre presse-papiers, repères de page compris.

Pourquoi le texte extrait est-il vide ?

Le PDF n’a presque certainement pas de couche de texte, ce qui est typique des scans et des pages photographiées. Essayez de surligner un mot dans votre lecteur PDF : si rien ne se sélectionne, il n’y a pas de texte à extraire. Passez d’abord le fichier dans l’outil OCR PDF pour ajouter une couche de texte consultable, puis revenez ici.

Pourquoi les deux colonnes sont-elles mélangées ?

L’outil suit l’ordre dans lequel le texte est stocké dans le fichier. Dans les mises en page à plusieurs colonnes, cet ordre peut sauter d’une colonne à l’autre, si bien que des lignes de colonnes différentes peuvent alterner.

Les tableaux, les images et la mise en forme sont-ils conservés ?

Non. Un fichier .txt ne contient que des caractères : la mise en forme et les images sont laissées de côté, et les cellules de tableau deviennent des mots séparés par des espaces ou des sauts de ligne.

À quoi servent les lignes « --- Page N --- » ?

Elles marquent le début de chaque page, ce qui vous aide à retrouver la page d’origine d’une citation. Si vous n’en voulez pas, supprimez-les avec la fonction rechercher-remplacer de votre éditeur.

Les accents et les autres langues sont-ils pris en charge ?

Oui, tant que le PDF stocke de vrais caractères Unicode. Le résultat est en UTF-8, qui couvre toutes les grandes écritures, des lettres latines accentuées au chinois et au japonais.

Mon document est-il envoyé quand j’extrais le texte ?

Non. L’extraction se fait entièrement dans votre navigateur, et le texte ne quitte jamais votre appareil, sauf si vous le collez vous-même ailleurs. Voyez comment le vérifier.

Dernière mise à jour :