Vai al contenuto

↑ ↓ per spostarti · Invio per aprire · Esc per chiudere

Estrai il testo da un PDF

Tira fuori le parole da un PDF, poi copiale o salvale in un semplice file .txt. L’estrazione avviene nel tuo browser, quindi il documento resta sul tuo dispositivo.

Tutto avviene sul tuo dispositivo: nessun file viene caricato. Come verificarlo

Trascina qui un PDF oppure scegli i file Un PDF alla volta

In breve

Un PDF esportato da un programma di videoscrittura o da una pagina web conserva le parole come caratteri veri, e pd00 le legge con pdf.js e salva un file .txt in UTF-8 con una riga --- Page N --- prima di ogni pagina. UTF-8 codifica qualsiasi carattere Unicode con un numero di byte da 1 a 4, quindi accenti, cirillico e cinese arrivano intatti. Le pagine scansionate non contengono caratteri ed escono vuote.

Istruzioni: PDF in testo

  1. Aggiungi il PDFSeleziona un PDF dal tuo dispositivo o trascinalo sullo strumento. Un file che chiede una password va sbloccato prima che se ne possa leggere il testo.
  2. Controlla il testo estrattoPremi «Estrai il testo» e il testo compare nell’anteprima, pagina per pagina, separato dalle righe --- Page N ---. Scorrilo per assicurarti che l’ordine di lettura abbia senso.
  3. Copialo o salva un file .txtPremi «Copia il testo» per mettere tutto negli appunti, oppure scaricalo come file di testo UTF-8 da cercare, modificare o incollare altrove.

Un esempio pratico

Un contratto d’affitto di 3 pagine, contratto.pdf: le pagine 1 e 2 sono state scritte con un programma di videoscrittura, la pagina 3 è il foglio delle firme scansionato. L’estrazione produce contratto.txt, in cui --- Page 1 --- e --- Page 2 --- sono seguite dai rispettivi paragrafi e --- Page 3 --- da niente, perché una scansione non contiene caratteri.

In quel file UTF-8 il nome dell’inquilino, «Nicolò», occupa 7 byte: uno ciascuno per N, i, c, o e l, e due per la ò.

Cosa fa e quali limiti ha

  • Legge solo un livello di testo già presente. Passa prima le scansioni da OCR PDF, poi estrai.
  • Lavora sempre sull’intero PDF, un file alla volta; isola prima un capitolo con Estrai pagine.
  • Il testo segue l’ordine in cui è salvato nel file, quindi pagine a due colonne e riquadri laterali possono uscire mescolati.
  • Font, immagini e celle delle tabelle si perdono; per titoli ed elenchi usa PDF in Markdown.

Fonti

Link verificati in data 10 ottobre 2026.

PDF in testo: cosa c’è da sapere

La maggior parte dei PDF creati da un programma di videoscrittura, da una pagina web o da un foglio di calcolo contiene testo vero: caratteri con la loro posizione, salvati accanto all’impaginazione visiva. Questo strumento legge quel livello di testo con pdf.js, la libreria PDF open source di Mozilla, e te lo restituisce come testo semplice. Ottieni un’anteprima sullo schermo con il pulsante Copia il testo, e puoi salvare tutto in un file .txt UTF-8 che si apre con qualsiasi editor di testo.

Prima del testo di ogni pagina il risultato inserisce una riga di riferimento come --- Page 3 ---, così capisci da dove viene un passaggio o puoi eliminare le pagine che non ti servono. Dato che il file è in UTF-8, lettere accentate, greco, cirillico, cinese, giapponese e altre scritture arrivano intatti, a patto che il PDF li conservi come caratteri autentici. Le proprietà del documento, come titolo e autore, non sono incluse: c’è solo il testo delle pagine.

I PDF scansionati escono vuoti

Un PDF prodotto da uno scanner o dalla fotocamera di un telefono di solito è solo una pila di foto delle pagine. Dentro non ci sono caratteri da estrarre, quindi il risultato è vuoto. Per leggere il testo dalle immagini serve l’OCR (riconoscimento del testo). Questo strumento non lo fa da solo, ma OCR PDF su questo sito sì, sempre dentro il tuo browser. Una prova veloce prima di cominciare: apri il PDF in un lettore qualsiasi e prova a evidenziare una parola. Se la selezione si aggancia alle lettere, il livello di testo c’è.

Quando ti serve

  • Citare un passaggio senza ribatterlo

    Ti serve un paragrafo di un contratto, di uno studio o di un manuale d’uso per un’email o una relazione? Estrai il testo, trova la pagina giusta grazie alla riga di riferimento e incolla solo la parte che ti serve.

  • Cercare o confrontare documenti lunghi

    Un file .txt si può cercare con qualsiasi editor, confrontare riga per riga con una bozza precedente usando uno strumento di diff, oppure caricare in un foglio di calcolo o in uno script per contare e ordinare.

  • Passare le parole a un’altra app

    Strumenti di traduzione, app di note e assistenti di chat accettano il testo semplice più volentieri di un PDF. Incollando il testo estratto condividi solo il passaggio che scegli, invece di caricare l’intero file originale.

Ordine di lettura e impaginazione

Il testo esce nell’ordine in cui è salvato dentro il PDF, che di solito, ma non sempre, coincide con l’ordine in cui lo leggerebbe una persona. I documenti a una colonna, come lettere, relazioni e la maggior parte degli ebook, si estraggono in modo pulito. Le impaginazioni con due o tre colonne, riquadri laterali, didascalie o caselle di testo mobili possono mescolarsi: una riga della colonna di sinistra seguita da una di quella di destra, oppure una didascalia che finisce in mezzo a un paragrafo.

La formattazione non fa parte del testo semplice. Grassetto, corsivo, dimensioni dei caratteri, colori e immagini vengono scartati, e le tabelle diventano sequenze di parole separate da spazi o a capo invece di celle ordinate. Quando conta più l’aspetto della pagina dei caratteri, un’immagine creata con PDF in PNG mantiene esattamente l’impaginazione, anche se sotto forma di pixel.

Perché non c’è un’impostazione di risoluzione

I convertitori di pd00 da pagina a immagine chiedono 72, 150 o 300 DPI perché disegnano ogni pagina come una griglia di pixel. L’estrazione del testo non disegna nulla. Legge direttamente i caratteri salvati, quindi non c’è una risoluzione da scegliere né una perdita di qualità: ottieni esattamente il testo che il PDF contiene. Anche il file risultante è leggero, perché un .txt contiene solo caratteri, senza font né immagini, e spesso è molto più piccolo del PDF da cui proviene.

Quando il risultato non torna

  • Non esce niente. Il PDF è una scansione o un’esportazione di immagini. Qui può aiutare solo l’OCR. Passa prima il file da OCR PDF, che aggiunge un livello di testo nascosto, poi estrai il testo con questo strumento.
  • Simboli strani al posto delle parole. Alcuni PDF incorporano font senza una tabella che ricolleghi le forme disegnate ai caratteri reali. A schermo la pagina sembra a posto, ma i codici salvati non significano nulla fuori da quel font, quindi le parole si possono recuperare solo con l’OCR.
  • Parole spezzate o attaccate. I PDF collocano il testo a frammenti in base alla posizione, quindi possono comparire spazi in più o in meno, soprattutto nei paragrafi giustificati o nei titoli con le lettere spaziate.
  • Il file è bloccato. Togli la password con Sblocca PDF (devi conoscerla), poi estrai.

Ti serve solo una parte del documento?

Lo strumento per il testo lavora sull’intero file. Se di un manuale di 400 pagine ti interessa un solo capitolo, ritaglialo prima con Estrai pagine o Dividi PDF, poi passa qui quel PDF più corto.

Il tuo testo resta riservato

Il PDF viene analizzato nella scheda del browser e il testo viene prodotto sul tuo dispositivo; né il file né le parole estratte vengono caricati da nessuna parte. È importante per contratti, referti medici e altre carte riservate. Segui i passaggi della pagina sulla privacy per verificarlo.

Domande e risposte

Come copio tutto il testo di un PDF?

Aggiungi qui il PDF e, quando il testo è comparso, premi Copia il testo. Finisce tutto negli appunti, righe di riferimento delle pagine comprese.

Perché il testo estratto è vuoto?

Quasi certamente il PDF non ha un livello di testo, cosa tipica di scansioni e pagine fotografate. Prova a evidenziare una parola nel tuo lettore PDF: se non si seleziona nulla, non c’è testo da estrarre. Passa prima il file dallo strumento OCR PDF per aggiungere un livello di testo ricercabile, poi torna qui.

Perché le due colonne sono mescolate?

Lo strumento segue l’ordine in cui il testo è salvato nel file. Nelle impaginazioni a più colonne quell’ordine può saltare da una colonna all’altra, quindi le righe di colonne diverse possono alternarsi.

Tabelle, immagini e formattazione vengono mantenute?

No. Un file .txt contiene solo caratteri, quindi stili e immagini restano fuori e le celle delle tabelle diventano parole separate da spazi o a capo.

A cosa servono le righe «--- Page N ---»?

Segnano dove comincia ogni pagina e ti aiutano a risalire alla pagina da cui viene una citazione. Se non le vuoi, eliminale con la funzione «trova e sostituisci» del tuo editor.

Funziona con testi in altre lingue?

Sì, purché il PDF contenga caratteri Unicode corretti. Il risultato è in UTF-8, che copre tutti i principali sistemi di scrittura, dalle lettere latine accentate al cinese e al giapponese.

Il mio documento viene caricato quando estraggo il testo?

No. L’estrazione avviene interamente nel tuo browser, e il testo non lascia il tuo dispositivo a meno che tu non lo incolli da qualche parte. Scopri come verificarlo.

Ultimo aggiornamento: