Em resumo
O OCR (reconhecimento de texto) transforma a imagem de cada letra de uma digitalização em texto de verdade, e texto pesquisável é o que a Biblioteca do Congresso dos EUA prefere nos PDFs que preserva. O pd00 renderiza cada página a 300 DPI, lê o conteúdo com o mecanismo LSTM do Tesseract usando até 3 dos 10 idiomas que o pd00 oferece e coloca as palavras de forma invisível sobre a página sem alterações, além de gerar uma cópia em .txt.
Passo a passo: OCR em PDF
- Escolha o PDF digitalizadoSelecione o arquivo ou solte-o na ferramenta. Uma digitalização protegida por senha precisa passar antes por Remover senha do PDF, e essa etapa exige a própria senha.
- Diga quais idiomas lerEm Idioma do texto (até 3), mantenha Português ou marque os idiomas em que o documento está escrito, até três para páginas que misturam idiomas.
- Reconheça o texto e baixeClique em Tornar pesquisável e deixe a aba aberta enquanto as páginas são processadas. Depois, salve o PDF pesquisável e também o arquivo .txt, se quiser só as palavras.
Um exemplo na prática
contrato.pdf tem 10 páginas A4: as páginas 1 a 8 são digitalizações, e as páginas 9 e 10 foram digitadas no computador e já têm texto. Com Português marcado e Pular páginas que já têm texto ativado, as páginas 1 a 8 são renderizadas com 2480 × 3507 pixels cada (210 mm ÷ 25,4 × 300 e 297 mm ÷ 25,4 × 300, arredondados para baixo) e lidas pelo Tesseract; as páginas 9 e 10, com pelo menos 20 caracteres cada, são puladas.
A linha de resultado mostra “8 páginas reconhecidas; ignoradas: 2”. Você baixa contrato-ocr.pdf, ainda com 10 páginas idênticas às de antes, e contrato-ocr.txt, em que os marcadores das páginas 9 e 10 ficam vazios, porque o texto que já existia nelas não é copiado.
O que a ferramenta faz e quais são os limites
- Escolha de 1 a 3 dos 10 idiomas por vez; cada modelo é baixado uma vez de pd00.com e fica no cache do navegador.
- Feito para texto impresso e digitado: letra à mão, assinaturas e caixas preenchidas são lidas sem confiabilidade, ou nem são lidas.
- Com a opção de pular ativada, páginas que já têm 20 caracteres ou mais não são lidas, e o texto delas fica fora do arquivo .txt.
- O resultado é pesquisável, não editável: cada página continua uma imagem com texto escondido por trás. Um PDF por vez.
Fontes
- Tesseract User Manual Tesseract OCR
- PDF (Portable Document Format) Family Library of Congress
- PDF.js Mozilla
- @cantoo/pdf-lib, a maintained fork of pdf-lib Cantoo on GitHub
Links verificados em 10 de outubro de 2026.
OCR em PDF: como funciona
Um scanner ou um app de digitalização no celular salva cada folha como uma imagem. O leitor de PDF só enxerga pixels, então a busca por um nome não encontra nada, e arrastar o cursor seleciona a página inteira em vez de uma frase. O reconhecimento de texto (OCR, na sigla em inglês) analisa esses pixels e descobre quais letras eles mostram.
Nesta página, cada página do seu arquivo é desenhada a 300 DPI com o pdf.js e passada ao Tesseract, o mecanismo de OCR de código aberto, na versão para navegador tesseract.js (licença Apache-2.0). As palavras reconhecidas são gravadas de volta no PDF como uma camada de texto invisível, posicionada sobre os pontos correspondentes da página original. A página visível não é mexida: a digitalização, as cores, os carimbos e as assinaturas continuam iguais. O que muda é que o documento passa a responder a uma busca, e você pode destacar e copiar trechos como em qualquer PDF feito no computador. Se você só quer as palavras, tudo o que foi reconhecido também é oferecido como um arquivo .txt simples.
Idiomas de reconhecimento
O Tesseract lê com mais precisão quando sabe qual idioma esperar. Português vem marcado por padrão. Também estão disponíveis Inglês, Espanhol, Francês, Alemão, Italiano, Chinês (simplificado), Chinês (tradicional), Japonês e Coreano. Cada modelo de idioma é um download de cerca de 0,7 a 3 MB, feito de pd00.com na primeira vez que você escolhe o idioma; o navegador guarda o modelo em cache para as próximas vezes.
Quando usar
Achar uma cláusula num contrato assinado
Um contrato assinado voltou como digitalização. Depois do OCR, buscar o nome de uma das partes ou a palavra rescisão leva direto ao parágrafo certo, sem folhear dezenas de imagens.
Papéis que você quer achar daqui a anos
Faturas, certificados de garantia e cartas digitalizados para guardar podem ser encontrados pelo que dizem, e não só pelo nome do arquivo, quando cada um tem uma camada de texto que a busca de arquivos do computador consegue indexar.
Citar um capítulo fotocopiado
Um capítulo de livro ou artigo de revista digitalizado numa apostila não pode ser citado sem redigitar. Com o OCR, você seleciona o trecho, copia e depois compara com a imagem da página para pegar caracteres mal lidos.
O que define a precisão do texto
O OCR só consegue ler o que a digitalização mostra, então a origem importa mais que qualquer configuração. Os melhores resultados vêm de páginas capturadas a 300 DPI, retas, com impressão escura sobre fundo claro. A precisão cai com:
- Baixa resolução ou imagem tremida. Renderizar a 300 DPI não recupera um detalhe que uma digitalização de baixa resolução nunca captou, e letras pequenas numa foto tremida de celular têm poucos pixels por letra.
- Páginas tortas ou de lado. Linhas inclinadas e a curva perto da lombada de um livro separam as palavras. Coloque em pé as páginas que estão de lado com Girar PDF antes de começar.
- Letra à mão. O Tesseract é feito para texto impresso e digitado. Anotações à mão, assinaturas e caixas preenchidas não são reconhecidas com confiabilidade.
- Um idioma faltando. Um texto em português lido só com Inglês tende a perder os acentos e o ç e a errar palavras, então marque todos os idiomas que as páginas usam.
Mesmo uma digitalização limpa vai ter um erro ou outro, como um 1 lido como l ou rn lido como m. A busca ainda encontra a maioria das palavras, mas revise tudo o que copiar para um documento importante.
Quanto tempo o reconhecimento leva
Conte com vários segundos por página num notebook e mais tempo no celular; uma carta de duas páginas fica pronta rápido, enquanto um relatório longo pode levar minutos, e a aba precisa ficar aberta até o fim. Arquivos longos são mais bem processados num computador. Quando você só precisa de um trecho de uma digitalização grande, separe essas páginas com Extrair páginas e faça o OCR no arquivo menor.
A opção Pular páginas que já têm texto vem ativada e economiza tempo em documentos mistos, como um relatório digitado com folhas de assinatura digitalizadas no final: só as páginas sem texto são reconhecidas. Desative a opção para que todas as páginas sejam lidas.
O que a cópia pesquisável mantém
Nada é limpo, endireitado ou acrescentado à página visível, então o resultado fica igual, na tela e no papel, à digitalização que você adicionou. O texto acrescentado é minúsculo perto dessas imagens, e por isso o arquivo costuma crescer só um pouco. Se você também quiser um PDF menor, passe-o por Comprimir PDF como uma etapa separada; para dar a ele um título claro no seu acervo, defina um em Editar metadados.
Arquivos que não precisam de OCR
- PDFs que já têm texto selecionável. Se você consegue destacar palavras no seu leitor de PDF, pule o OCR e copie as palavras com PDF para texto, ou mantenha títulos e listas com PDF para Markdown.
- Documentos que você quer editar. O OCR torna uma digitalização pesquisável, não editável. Cada página continua uma imagem com texto por trás, então não dá para redigitar uma frase no lugar.
As páginas são renderizadas e lidas dentro desta aba do navegador. Os únicos downloads extras são os modelos de idioma, buscados em pd00.com, e nem a sua digitalização nem o texto dela são enviados a lugar nenhum; veja como conferir.