# Faça OCR em um PDF digitalizado para pesquisar o texto

Dê a um PDF digitalizado uma camada escondida de texto de verdade para pesquisar, selecionar e copiar as palavras. O reconhecimento de texto roda no seu próprio aparelho, e cada página mantém exatamente a mesma aparência.

## Em resumo

O OCR (reconhecimento de texto) transforma a imagem de cada letra de uma digitalização em texto de verdade, e texto pesquisável é o que a Biblioteca do Congresso dos EUA prefere nos PDFs que preserva. O pd00 renderiza cada página a 300 DPI, lê o conteúdo com o mecanismo LSTM do Tesseract usando até 3 dos 10 idiomas que o pd00 oferece e coloca as palavras de forma invisível sobre a página sem alterações, além de gerar uma cópia em `.txt`.

## Passo a passo: OCR em PDF

1. **Escolha o PDF digitalizado**  
   Selecione o arquivo ou solte-o na ferramenta. Uma digitalização protegida por senha precisa passar antes por Remover senha do PDF, e essa etapa exige a própria senha.
2. **Diga quais idiomas ler**  
   Em Idioma do texto (até 3), mantenha Português ou marque os idiomas em que o documento está escrito, até três para páginas que misturam idiomas.
3. **Reconheça o texto e baixe**  
   Clique em Tornar pesquisável e deixe a aba aberta enquanto as páginas são processadas. Depois, salve o PDF pesquisável e também o arquivo .txt, se quiser só as palavras.

## Um exemplo na prática

`contrato.pdf` tem 10 páginas A4: as páginas 1 a 8 são digitalizações, e as páginas 9 e 10 foram digitadas no computador e já têm texto. Com Português marcado e **Pular páginas que já têm texto** ativado, as páginas 1 a 8 são renderizadas com 2480 × 3507 pixels cada (210 mm ÷ 25,4 × 300 e 297 mm ÷ 25,4 × 300, arredondados para baixo) e lidas pelo Tesseract; as páginas 9 e 10, com pelo menos 20 caracteres cada, são puladas.

A linha de resultado mostra “8 páginas reconhecidas; ignoradas: 2”. Você baixa `contrato-ocr.pdf`, ainda com 10 páginas idênticas às de antes, e `contrato-ocr.txt`, em que os marcadores das páginas 9 e 10 ficam vazios, porque o texto que já existia nelas não é copiado.

## O que a ferramenta faz e quais são os limites

- Escolha de 1 a 3 dos 10 idiomas por vez; cada modelo é baixado uma vez de pd00.com e fica no cache do navegador.
- Feito para texto impresso e digitado: letra à mão, assinaturas e caixas preenchidas são lidas sem confiabilidade, ou nem são lidas.
- Com a opção de pular ativada, páginas que já têm 20 caracteres ou mais não são lidas, e o texto delas fica fora do arquivo .txt.
- O resultado é pesquisável, não editável: cada página continua uma imagem com texto escondido por trás. Um PDF por vez.

## Fontes

- [Tesseract User Manual](https://tesseract-ocr.github.io/tessdoc/), Tesseract OCR
- [PDF (Portable Document Format) Family](https://www.loc.gov/preservation/digital/formats/fdd/fdd000030.shtml), Library of Congress
- [PDF.js](https://mozilla.github.io/pdf.js/), Mozilla
- [@cantoo/pdf-lib, a maintained fork of pdf-lib](https://github.com/cantoo-scribe/pdf-lib), Cantoo on GitHub

Links verificados em 10 de outubro de 2026.

## OCR em PDF: como funciona

Um scanner ou um app de digitalização no celular salva cada folha como uma imagem. O leitor de PDF só enxerga pixels, então a busca por um nome não encontra nada, e arrastar o cursor seleciona a página inteira em vez de uma frase. O reconhecimento de texto (OCR, na sigla em inglês) analisa esses pixels e descobre quais letras eles mostram.

Nesta página, cada página do seu arquivo é desenhada a 300 DPI com o pdf.js e passada ao Tesseract, o mecanismo de OCR de código aberto, na versão para navegador tesseract.js (licença Apache-2.0). As palavras reconhecidas são gravadas de volta no PDF como uma camada de texto invisível, posicionada sobre os pontos correspondentes da página original. A página visível não é mexida: a digitalização, as cores, os carimbos e as assinaturas continuam iguais. O que muda é que o documento passa a responder a uma busca, e você pode destacar e copiar trechos como em qualquer PDF feito no computador. Se você só quer as palavras, tudo o que foi reconhecido também é oferecido como um arquivo `.txt` simples.

### Idiomas de reconhecimento

O Tesseract lê com mais precisão quando sabe qual idioma esperar. Português vem marcado por padrão. Também estão disponíveis Inglês, Espanhol, Francês, Alemão, Italiano, Chinês (simplificado), Chinês (tradicional), Japonês e Coreano. Cada modelo de idioma é um download de cerca de 0,7 a 3 MB, feito de pd00.com na primeira vez que você escolhe o idioma; o navegador guarda o modelo em cache para as próximas vezes.

## Quando usar

### Achar uma cláusula num contrato assinado

Um contrato assinado voltou como digitalização. Depois do OCR, buscar o nome de uma das partes ou a palavra rescisão leva direto ao parágrafo certo, sem folhear dezenas de imagens.

### Papéis que você quer achar daqui a anos

Faturas, certificados de garantia e cartas digitalizados para guardar podem ser encontrados pelo que dizem, e não só pelo nome do arquivo, quando cada um tem uma camada de texto que a busca de arquivos do computador consegue indexar.

### Citar um capítulo fotocopiado

Um capítulo de livro ou artigo de revista digitalizado numa apostila não pode ser citado sem redigitar. Com o OCR, você seleciona o trecho, copia e depois compara com a imagem da página para pegar caracteres mal lidos.

## O que define a precisão do texto

O OCR só consegue ler o que a digitalização mostra, então a origem importa mais que qualquer configuração. Os melhores resultados vêm de páginas capturadas a 300 DPI, retas, com impressão escura sobre fundo claro. A precisão cai com:

- **Baixa resolução ou imagem tremida.** Renderizar a 300 DPI não recupera um detalhe que uma digitalização de baixa resolução nunca captou, e letras pequenas numa foto tremida de celular têm poucos pixels por letra.
- **Páginas tortas ou de lado.** Linhas inclinadas e a curva perto da lombada de um livro separam as palavras. Coloque em pé as páginas que estão de lado com [Girar PDF](https://pd00.com/pt/girar-pdf/) antes de começar.
- **Letra à mão.** O Tesseract é feito para texto impresso e digitado. Anotações à mão, assinaturas e caixas preenchidas não são reconhecidas com confiabilidade.
- **Um idioma faltando.** Um texto em português lido só com Inglês tende a perder os acentos e o ç e a errar palavras, então marque todos os idiomas que as páginas usam.

Mesmo uma digitalização limpa vai ter um erro ou outro, como um 1 lido como l ou rn lido como m. A busca ainda encontra a maioria das palavras, mas revise tudo o que copiar para um documento importante.

## Quanto tempo o reconhecimento leva

Conte com vários segundos por página num notebook e mais tempo no celular; uma carta de duas páginas fica pronta rápido, enquanto um relatório longo pode levar minutos, e a aba precisa ficar aberta até o fim. Arquivos longos são mais bem processados num computador. Quando você só precisa de um trecho de uma digitalização grande, separe essas páginas com [Extrair páginas](https://pd00.com/pt/extrair-paginas-pdf/) e faça o OCR no arquivo menor.

A opção Pular páginas que já têm texto vem ativada e economiza tempo em documentos mistos, como um relatório digitado com folhas de assinatura digitalizadas no final: só as páginas sem texto são reconhecidas. Desative a opção para que todas as páginas sejam lidas.

## O que a cópia pesquisável mantém

Nada é limpo, endireitado ou acrescentado à página visível, então o resultado fica igual, na tela e no papel, à digitalização que você adicionou. O texto acrescentado é minúsculo perto dessas imagens, e por isso o arquivo costuma crescer só um pouco. Se você também quiser um PDF menor, passe-o por [Comprimir PDF](https://pd00.com/pt/comprimir-pdf/) como uma etapa separada; para dar a ele um título claro no seu acervo, defina um em [Editar metadados](https://pd00.com/pt/editar-metadados-pdf/).

## Arquivos que não precisam de OCR

- **PDFs que já têm texto selecionável.** Se você consegue destacar palavras no seu leitor de PDF, pule o OCR e copie as palavras com [PDF para texto](https://pd00.com/pt/pdf-para-texto/), ou mantenha títulos e listas com [PDF para Markdown](https://pd00.com/pt/pdf-para-markdown/).
- **Documentos que você quer editar.** O OCR torna uma digitalização pesquisável, não editável. Cada página continua uma imagem com texto por trás, então não dá para redigitar uma frase no lugar.

As páginas são renderizadas e lidas dentro desta aba do navegador. Os únicos downloads extras são os modelos de idioma, buscados em pd00.com, e nem a sua digitalização nem o texto dela são enviados a lugar nenhum; [veja como conferir](https://pd00.com/pt/privacidade/#verify).

## Perguntas frequentes

### Como deixar um PDF digitalizado pesquisável?

Adicione o PDF aqui, marque o idioma em que ele está escrito e clique em **Tornar pesquisável**. O PDF que você baixa tem uma camada de texto invisível, então `Ctrl+F` (`Cmd+F` no Mac) encontra palavras nas páginas digitalizadas.

### O OCR muda a aparência das páginas?

Não. As palavras reconhecidas ficam invisíveis sobre a imagem original de cada página, então o documento fica idêntico em qualquer leitor de PDF.

### Posso converter um PDF digitalizado em texto?

Sim. Junto com o PDF pesquisável, a ferramenta oferece as palavras reconhecidas num arquivo `.txt`. Confira nomes, números e valores com a digitalização, porque o OCR pode ler caracteres errado.

### Quais idiomas ele reconhece?

Português, inglês, espanhol, francês, alemão, italiano, chinês (simplificado), chinês (tradicional), japonês e coreano. Dá para combinar até três. Cada modelo de idioma é baixado uma vez de pd00.com e fica no cache do navegador.

### Ele lê letra à mão?

Não com confiabilidade. O Tesseract foi feito para texto impresso e digitado, então palavras escritas à mão muitas vezes saem erradas ou são puladas.

### A minha digitalização é enviada a um servidor para o reconhecimento?

Não. O Tesseract roda na aba do navegador e o PDF fica no seu aparelho; só os modelos de idioma são baixados, de pd00.com. Veja [como conferir isso](https://pd00.com/pt/privacidade/#verify).

Atualizado em 11 de outubro de 2026  
https://pd00.com/pt/ocr-pdf/
