En bref
Un PDF exporté depuis un traitement de texte ou une page web garde ses mots sous forme de vrais caractères : pd00 les lit avec pdf.js et enregistre un fichier .txt en UTF-8, avec une ligne --- Page N --- avant chaque page. L’UTF-8 encode n’importe quel caractère Unicode sur 1 à 4 octets, si bien que les accents, le cyrillique et le chinois passent sans dommage. Les pages scannées ne contiennent aucun caractère et sortent vides.
Mode d’emploi : PDF en texte
- Ajoutez votre PDFChoisissez un PDF sur votre appareil ou faites-le glisser sur l’outil. Un fichier qui demande un mot de passe doit être déverrouillé avant que son texte puisse être lu.
- Vérifiez le texte extraitLancez l’extraction : le texte apparaît dans l’aperçu, page par page, séparé par des lignes --- Page N ---. Parcourez-le pour vérifier que l’ordre de lecture tient la route.
- Copiez-le ou enregistrez un fichier .txtAppuyez sur « Copier le texte » pour tout mettre dans le presse-papiers, ou téléchargez-le sous forme de fichier texte UTF-8 que vous pourrez fouiller, modifier ou coller ailleurs.
Un exemple concret
Un bail de 3 pages, bail.pdf : les pages 1 et 2 ont été tapées dans un traitement de texte, et la page 3 est une page de signatures scannée. L’extraction donne bail.txt, où --- Page 1 --- et --- Page 2 --- sont suivies de leurs paragraphes, et --- Page 3 --- de rien du tout, car un scan ne contient aucun caractère.
Dans ce fichier UTF-8, le prénom de la locataire, « Hélène », occupe 8 octets : un chacun pour H, l, n et le e final, et deux chacun pour le é et le è (4 + 4 = 8).
Ce que fait l’outil, et ses limites
- Ne lit qu’une couche de texte existante. Passez d’abord les scans dans OCR PDF, puis lancez l’extraction.
- Couvre toujours tout le PDF, un fichier par opération ; isolez un chapitre au préalable avec Extraire des pages.
- Le texte suit l’ordre dans lequel il est stocké dans le fichier : les pages à deux colonnes et les encadrés peuvent sortir entremêlés.
- Les polices, les images et les cellules de tableau sont perdues ; pour les titres et les listes, utilisez PDF en Markdown.
Sources
- PDF.js Mozilla
- RFC 3629: UTF-8, a transformation format of ISO 10646 RFC Editor
Liens vérifiés le 10 octobre 2026.
PDF en texte : ce qu’il faut savoir
La plupart des PDF créés depuis un traitement de texte, une page web ou un tableur contiennent du vrai texte : des caractères avec leur position, stockés à côté de la mise en page visuelle. Cet outil lit cette couche de texte avec pdf.js, la bibliothèque PDF open source de Mozilla, et vous la rend sous forme de texte brut. Vous obtenez un aperçu à l’écran avec un bouton Copier le texte, et vous pouvez tout enregistrer dans un fichier .txt en UTF-8 qui s’ouvre dans n’importe quel éditeur de texte.
Avant le texte de chaque page, le résultat insère une ligne de repère comme --- Page 3 --- : vous savez ainsi d’où vient un passage, et vous pouvez supprimer les pages inutiles. Comme le fichier est en UTF-8, les lettres accentuées, le grec, le cyrillique, le chinois, le japonais et les autres écritures passent sans dommage, à condition que le PDF les stocke comme de vrais caractères. Les propriétés du document, comme le titre et l’auteur, ne sont pas incluses ; seul le texte des pages l’est.
Les PDF scannés sortent vides
Un PDF produit par un scanner ou l’appareil photo d’un téléphone n’est en général qu’une pile de photos de pages. Il n’y a aucun caractère à extraire : le résultat est vide. Lire du texte dans des images demande l’OCR (reconnaissance optique de caractères). Cet outil ne le fait pas lui-même, mais OCR PDF, sur ce site, s’en charge, lui aussi dans votre navigateur. Un test rapide avant de commencer : ouvrez le PDF dans n’importe quel lecteur PDF et essayez de surligner un mot. Si la sélection s’accroche aux lettres, la couche de texte est bien là.
Dans quels cas l’utiliser
Citer un passage sans le retaper
Besoin d’un paragraphe d’un contrat, d’une étude ou d’un mode d’emploi pour un e-mail ou un rapport ? Extrayez le texte, retrouvez la bonne page grâce à son repère et collez uniquement la partie utile.
Rechercher dans de longs documents ou les comparer
Un fichier .txt se fouille dans n’importe quel éditeur, se compare ligne à ligne avec une version précédente grâce à un outil de comparaison (diff), ou se charge dans un tableur ou un script pour compter et trier.
Confier les mots à une autre appli
Les outils de traduction, les applis de notes et les assistants conversationnels acceptent plus volontiers du texte brut qu’un PDF. En collant le texte extrait, vous ne partagez que le passage choisi au lieu d’envoyer tout le fichier d’origine.
Ordre de lecture et mise en page
Le texte sort dans l’ordre où il est stocké dans le PDF, qui correspond généralement, mais pas toujours, à l’ordre dans lequel une personne le lirait. Les documents sur une seule colonne, comme les lettres, les rapports et la plupart des livres numériques, s’extraient proprement. Les mises en page à deux ou trois colonnes, avec encadrés, légendes ou blocs de texte flottants, peuvent s’entremêler : une ligne de la colonne de gauche suivie d’une ligne de celle de droite, ou une légende qui atterrit au milieu d’un paragraphe.
La mise en forme ne fait pas partie du texte brut. Le gras, l’italique, les tailles de police, les couleurs et les images disparaissent, et les tableaux deviennent des suites de mots séparés par des espaces ou des sauts de ligne, et non des cellules bien rangées. Quand l’aspect de la page compte plus que les caractères, une image obtenue avec PDF en PNG conserve exactement la mise en page, mais sous forme de pixels.
Pourquoi il n’y a pas de réglage de résolution
Les convertisseurs de pages en images de pd00 demandent 72, 150 ou 300 DPI, car ils dessinent chaque page sous forme de grille de pixels. L’extraction de texte ne dessine rien du tout. Elle lit directement les caractères stockés : il n’y a donc aucune résolution à choisir et aucune perte de qualité, et vous obtenez exactement le texte que contient le PDF. Le fichier obtenu est aussi léger, puisqu’un .txt ne contient que des caractères, sans polices ni images ; il est souvent bien plus petit que le PDF d’origine.
Quand le résultat semble faux
- Rien ne sort. Le PDF est un scan ou un export d’images. Seul l’OCR peut aider ici. Passez d’abord le fichier dans OCR PDF, qui ajoute une couche de texte invisible, puis extrayez le texte avec cet outil.
- Des symboles bizarres à la place des mots. Certains PDF incorporent des polices sans table de correspondance entre les formes dessinées et les vrais caractères. La page s’affiche bien à l’écran, mais les codes stockés n’ont aucun sens hors de cette police : les mots ne peuvent donc être récupérés que par OCR.
- Des mots coupés ou collés. Les PDF placent le texte par fragments selon leur position : des espaces en trop ou manquants peuvent apparaître, surtout dans les paragraphes justifiés ou les titres aux lettres espacées.
- Le fichier est verrouillé. Supprimez le mot de passe avec Déverrouiller un PDF (vous devez le connaître), puis lancez l’extraction.
Besoin d’une partie du document seulement ?
L’outil de texte traite le fichier entier. Pour un manuel de 400 pages dont vous ne voulez qu’un chapitre, découpez-le d’abord avec Extraire des pages ou Diviser un PDF, puis passez ce PDF plus court dans cet outil.
Votre texte reste privé
Le PDF est analysé dans l’onglet de votre navigateur et le texte est produit sur votre appareil ; ni le fichier ni les mots extraits ne sont envoyés où que ce soit. C’est important pour les contrats, les courriers médicaux et autres papiers confidentiels. Suivez les étapes de la page de confidentialité pour le confirmer.