In breve
L’OCR, cioè il riconoscimento del testo, trasforma l’immagine di ogni lettera di una scansione in testo vero, e il testo ricercabile è proprio ciò che la Biblioteca del Congresso degli Stati Uniti preferisce nei PDF che conserva. pd00 disegna ogni pagina a 300 DPI, la legge con il motore LSTM di Tesseract usando fino a 3 delle 10 lingue disponibili su pd00 e posa le parole, invisibili, sopra la pagina rimasta identica, più una copia in .txt.
Istruzioni: OCR PDF
- Scegli il PDF scansionatoSeleziona il file o trascinalo sullo strumento. Una scansione protetta da password deve passare prima da Sblocca PDF, e per quel passaggio serve la password stessa.
- Indica quali lingue leggereIn «Lingua del testo (fino a 3)» lascia l’italiano o seleziona le lingue in cui è scritto il documento, fino a tre per le pagine che le mescolano.
- Avvia il riconoscimento e scaricaPremi «Rendi ricercabile» e tieni aperta la scheda mentre lavora pagina per pagina. Poi salva il PDF ricercabile, più il file .txt se vuoi solo le parole.
Un esempio pratico
contratto.pdf ha 10 pagine A4: dalla 1 alla 8 sono scansioni, mentre la 9 e la 10 sono state scritte al computer e contengono già testo. Con l’italiano selezionato e Salta le pagine che contengono già testo lasciata attiva, le pagine da 1 a 8 vengono disegnate ciascuna a circa 2.480 × 3.508 pixel (210 mm e 297 mm a 300 DPI) e lette da Tesseract; la 9 e la 10, con almeno 20 caratteri ciascuna, vengono saltate.
La riga del risultato indica 8 pagine riconosciute e 2 saltate. Scarichi contratto-ocr.pdf, sempre 10 pagine con lo stesso identico aspetto di prima, e contratto-ocr.txt, in cui i segnaposto delle pagine 9 e 10 restano vuoti perché il loro testo già presente non viene copiato.
Cosa fa e quali limiti ha
- Scegli da 1 a 3 delle 10 lingue per ogni passaggio; ogni modello si scarica una volta da pd00.com e il browser lo tiene in cache.
- Pensato per il testo stampato o battuto a macchina: scrittura a mano, firme e caselle compilate vengono lette male o per niente.
- Con il salto attivo, le pagine che contengono già 20 o più caratteri non vengono lette e il loro testo resta fuori dal file .txt.
- Il risultato è ricercabile, non modificabile: ogni pagina resta un’immagine con il testo nascosto dietro. Un PDF alla volta.
Fonti
- Tesseract User Manual Tesseract OCR
- PDF (Portable Document Format) Family Library of Congress
- PDF.js Mozilla
- @cantoo/pdf-lib, a maintained fork of pdf-lib Cantoo on GitHub
Link verificati in data 10 ottobre 2026.
OCR PDF: cosa c’è da sapere
Uno scanner o un’app di scansione sul telefono salva ogni foglio come un’immagine. Un lettore PDF vede solo pixel, quindi se cerchi un nome non trova niente e trascinando il cursore selezioni tutta la pagina invece di una frase. Il riconoscimento del testo (OCR) studia quei pixel e capisce quali lettere rappresentano.
Qui ogni pagina del tuo file viene disegnata a 300 DPI con pdf.js e passata a Tesseract, il motore OCR open source, nella sua versione per browser tesseract.js (licenza Apache-2.0). Le parole riconosciute vengono riscritte nel PDF come un livello di testo invisibile, posizionato sopra i punti corrispondenti della pagina originale. La pagina visibile resta com’è: la scansione, i colori, i timbri e le firme hanno lo stesso aspetto di prima. Quello che cambia è che ora il documento risponde a una ricerca, e puoi evidenziare e copiare il testo come in qualsiasi PDF creato al computer. Se ti servono solo le parole, tutto il testo riconosciuto è disponibile anche come semplice file .txt.
Lingue di riconoscimento
Tesseract legge con più precisione quando sa quale lingua aspettarsi. In questa pagina l’italiano è selezionato in partenza. Sono disponibili anche inglese, spagnolo, francese, tedesco, portoghese, cinese (semplificato), cinese (tradizionale), giapponese e coreano. Ogni modello di lingua è un download da circa 0,7 a 3 MB da pd00.com la prima volta che lo scegli; poi il browser lo tiene in cache per le volte successive.
Quando ti serve
Trovare una clausola in un contratto firmato
Un contratto firmato è tornato indietro come scansione. Dopo l’OCR, cercando il nome di una delle parti o la parola recesso arrivi subito al paragrafo giusto, invece di sfogliare decine di immagini.
Documenti cartacei da ritrovare dopo anni
Fatture, certificati di garanzia e lettere scansionati per conservarli si possono ritrovare in base a ciò che dicono, e non solo al nome del file, quando ognuno ha un livello di testo che la ricerca dei file del computer può indicizzare.
Citare un capitolo fotocopiato
Il capitolo di un libro o un articolo scansionato in una dispensa universitaria non si può citare senza ribatterlo a mano. Con l’OCR selezioni il passaggio, lo copi e poi lo confronti con l’immagine della pagina per scovare i caratteri letti male.
Cosa decide la precisione del testo
L’OCR può leggere solo ciò che la scansione mostra, quindi conta più la qualità dell’originale di qualsiasi impostazione. I risultati migliori arrivano da pagine acquisite a 300 DPI, dritte, con stampa scura su fondo chiaro. La precisione cala con:
- Bassa risoluzione o sfocatura. Disegnare la pagina a 300 DPI non può ricreare dettagli che una scansione a bassa risoluzione non ha mai catturato, e i caratteri piccoli in una foto mossa fatta col telefono hanno troppo pochi pixel per lettera.
- Pagine storte o di lato. Righe inclinate e la curvatura vicino alla rilegatura di un libro spezzano le parole. Prima di iniziare, raddrizza le pagine coricate su un fianco con Ruota PDF.
- Scrittura a mano. Tesseract è fatto per il testo stampato o battuto a macchina. Appunti scritti a mano, firme e caselle compilate non vengono riconosciuti in modo affidabile.
- Una lingua mancante. Una lettera in tedesco letta solo con l’italiano tende a perdere le dieresi e a sbagliare le parole, quindi seleziona tutte le lingue usate nelle pagine.
Anche una scansione pulita conterrà qualche errore, come un 1 letto come l o rn letto come m. La ricerca trova comunque quasi tutte le parole, ma rileggi con attenzione tutto ciò che copi in un documento importante.
Quanto dura il riconoscimento
Calcola diversi secondi per pagina su un portatile e di più su un telefono: una lettera di due pagine è pronta in fretta, mentre una relazione lunga può richiedere minuti, e la scheda deve restare aperta fino alla fine. I file lunghi è meglio elaborarli su un computer. Se ti serve solo una parte di una scansione grande, estrai quelle pagine con Estrai pagine e fai l’OCR sul file più corto.
L’opzione «Salta le pagine che contengono già testo» è attiva in partenza e fa risparmiare tempo con i documenti misti, come una relazione scritta al computer con in fondo i fogli delle firme scansionati: vengono riconosciute solo le pagine senza testo. Disattivala se vuoi che vengano lette tutte le pagine.
Cosa conserva la copia ricercabile
Sulla pagina visibile non viene ripulito, raddrizzato o aggiunto niente, quindi il risultato appare sullo schermo e su carta uguale alla scansione che hai aggiunto. Il testo aggiunto pesa pochissimo rispetto alle immagini, quindi di solito il file cresce solo un po’. Se vuoi anche un PDF più leggero, passalo da Comprimi PDF in un secondo momento; per dargli un titolo chiaro per l’archivio, impostalo con Metadati PDF.
File che non hanno bisogno dell’OCR
- PDF che hanno già testo selezionabile. Se nel tuo lettore PDF riesci a evidenziare le parole, salta l’OCR e copia il testo con PDF in testo, oppure conserva titoli ed elenchi con PDF in Markdown.
- Documenti che vuoi modificare. L’OCR rende una scansione ricercabile, non modificabile. Ogni pagina resta un’immagine con il testo dietro, quindi non puoi riscrivere una frase al suo posto.
Le pagine vengono disegnate e lette dentro questa scheda del browser. Gli unici download in più sono i modelli di lingua, scaricati da pd00.com, e né la tua scansione né il suo testo vengono inviati da nessuna parte; ecco come verificarlo.