Pular para o conteúdo

↑ ↓ para navegar · Enter para abrir · Esc para fechar

Faça OCR em um PDF digitalizado para pesquisar o texto

Dê a um PDF digitalizado uma camada escondida de texto de verdade para pesquisar, selecionar e copiar as palavras. O reconhecimento de texto roda no seu próprio aparelho, e cada página mantém exatamente a mesma aparência.

Tudo roda no seu aparelho — os arquivos nunca são enviados. Como conferir

Solte um PDF aqui ou escolha arquivos Um PDF por vez
Idioma do texto (até 3)

Em resumo

O OCR (reconhecimento de texto) transforma a imagem de cada letra de uma digitalização em texto de verdade, e texto pesquisável é o que a Biblioteca do Congresso dos EUA prefere nos PDFs que preserva. O pd00 renderiza cada página a 300 DPI, lê o conteúdo com o mecanismo LSTM do Tesseract usando até 3 dos 10 idiomas que o pd00 oferece e coloca as palavras de forma invisível sobre a página sem alterações, além de gerar uma cópia em .txt.

Passo a passo: OCR em PDF

  1. Escolha o PDF digitalizadoSelecione o arquivo ou solte-o na ferramenta. Uma digitalização protegida por senha precisa passar antes por Remover senha do PDF, e essa etapa exige a própria senha.
  2. Diga quais idiomas lerEm Idioma do texto (até 3), mantenha Português ou marque os idiomas em que o documento está escrito, até três para páginas que misturam idiomas.
  3. Reconheça o texto e baixeClique em Tornar pesquisável e deixe a aba aberta enquanto as páginas são processadas. Depois, salve o PDF pesquisável e também o arquivo .txt, se quiser só as palavras.

Um exemplo na prática

contrato.pdf tem 10 páginas A4: as páginas 1 a 8 são digitalizações, e as páginas 9 e 10 foram digitadas no computador e já têm texto. Com Português marcado e Pular páginas que já têm texto ativado, as páginas 1 a 8 são renderizadas com 2480 × 3507 pixels cada (210 mm ÷ 25,4 × 300 e 297 mm ÷ 25,4 × 300, arredondados para baixo) e lidas pelo Tesseract; as páginas 9 e 10, com pelo menos 20 caracteres cada, são puladas.

A linha de resultado mostra “8 páginas reconhecidas; ignoradas: 2”. Você baixa contrato-ocr.pdf, ainda com 10 páginas idênticas às de antes, e contrato-ocr.txt, em que os marcadores das páginas 9 e 10 ficam vazios, porque o texto que já existia nelas não é copiado.

O que a ferramenta faz e quais são os limites

  • Escolha de 1 a 3 dos 10 idiomas por vez; cada modelo é baixado uma vez de pd00.com e fica no cache do navegador.
  • Feito para texto impresso e digitado: letra à mão, assinaturas e caixas preenchidas são lidas sem confiabilidade, ou nem são lidas.
  • Com a opção de pular ativada, páginas que já têm 20 caracteres ou mais não são lidas, e o texto delas fica fora do arquivo .txt.
  • O resultado é pesquisável, não editável: cada página continua uma imagem com texto escondido por trás. Um PDF por vez.

Fontes

Links verificados em 10 de outubro de 2026.

OCR em PDF: como funciona

Um scanner ou um app de digitalização no celular salva cada folha como uma imagem. O leitor de PDF só enxerga pixels, então a busca por um nome não encontra nada, e arrastar o cursor seleciona a página inteira em vez de uma frase. O reconhecimento de texto (OCR, na sigla em inglês) analisa esses pixels e descobre quais letras eles mostram.

Nesta página, cada página do seu arquivo é desenhada a 300 DPI com o pdf.js e passada ao Tesseract, o mecanismo de OCR de código aberto, na versão para navegador tesseract.js (licença Apache-2.0). As palavras reconhecidas são gravadas de volta no PDF como uma camada de texto invisível, posicionada sobre os pontos correspondentes da página original. A página visível não é mexida: a digitalização, as cores, os carimbos e as assinaturas continuam iguais. O que muda é que o documento passa a responder a uma busca, e você pode destacar e copiar trechos como em qualquer PDF feito no computador. Se você só quer as palavras, tudo o que foi reconhecido também é oferecido como um arquivo .txt simples.

Idiomas de reconhecimento

O Tesseract lê com mais precisão quando sabe qual idioma esperar. Português vem marcado por padrão. Também estão disponíveis Inglês, Espanhol, Francês, Alemão, Italiano, Chinês (simplificado), Chinês (tradicional), Japonês e Coreano. Cada modelo de idioma é um download de cerca de 0,7 a 3 MB, feito de pd00.com na primeira vez que você escolhe o idioma; o navegador guarda o modelo em cache para as próximas vezes.

Quando usar

  • Achar uma cláusula num contrato assinado

    Um contrato assinado voltou como digitalização. Depois do OCR, buscar o nome de uma das partes ou a palavra rescisão leva direto ao parágrafo certo, sem folhear dezenas de imagens.

  • Papéis que você quer achar daqui a anos

    Faturas, certificados de garantia e cartas digitalizados para guardar podem ser encontrados pelo que dizem, e não só pelo nome do arquivo, quando cada um tem uma camada de texto que a busca de arquivos do computador consegue indexar.

  • Citar um capítulo fotocopiado

    Um capítulo de livro ou artigo de revista digitalizado numa apostila não pode ser citado sem redigitar. Com o OCR, você seleciona o trecho, copia e depois compara com a imagem da página para pegar caracteres mal lidos.

O que define a precisão do texto

O OCR só consegue ler o que a digitalização mostra, então a origem importa mais que qualquer configuração. Os melhores resultados vêm de páginas capturadas a 300 DPI, retas, com impressão escura sobre fundo claro. A precisão cai com:

  • Baixa resolução ou imagem tremida. Renderizar a 300 DPI não recupera um detalhe que uma digitalização de baixa resolução nunca captou, e letras pequenas numa foto tremida de celular têm poucos pixels por letra.
  • Páginas tortas ou de lado. Linhas inclinadas e a curva perto da lombada de um livro separam as palavras. Coloque em pé as páginas que estão de lado com Girar PDF antes de começar.
  • Letra à mão. O Tesseract é feito para texto impresso e digitado. Anotações à mão, assinaturas e caixas preenchidas não são reconhecidas com confiabilidade.
  • Um idioma faltando. Um texto em português lido só com Inglês tende a perder os acentos e o ç e a errar palavras, então marque todos os idiomas que as páginas usam.

Mesmo uma digitalização limpa vai ter um erro ou outro, como um 1 lido como l ou rn lido como m. A busca ainda encontra a maioria das palavras, mas revise tudo o que copiar para um documento importante.

Quanto tempo o reconhecimento leva

Conte com vários segundos por página num notebook e mais tempo no celular; uma carta de duas páginas fica pronta rápido, enquanto um relatório longo pode levar minutos, e a aba precisa ficar aberta até o fim. Arquivos longos são mais bem processados num computador. Quando você só precisa de um trecho de uma digitalização grande, separe essas páginas com Extrair páginas e faça o OCR no arquivo menor.

A opção Pular páginas que já têm texto vem ativada e economiza tempo em documentos mistos, como um relatório digitado com folhas de assinatura digitalizadas no final: só as páginas sem texto são reconhecidas. Desative a opção para que todas as páginas sejam lidas.

O que a cópia pesquisável mantém

Nada é limpo, endireitado ou acrescentado à página visível, então o resultado fica igual, na tela e no papel, à digitalização que você adicionou. O texto acrescentado é minúsculo perto dessas imagens, e por isso o arquivo costuma crescer só um pouco. Se você também quiser um PDF menor, passe-o por Comprimir PDF como uma etapa separada; para dar a ele um título claro no seu acervo, defina um em Editar metadados.

Arquivos que não precisam de OCR

  • PDFs que já têm texto selecionável. Se você consegue destacar palavras no seu leitor de PDF, pule o OCR e copie as palavras com PDF para texto, ou mantenha títulos e listas com PDF para Markdown.
  • Documentos que você quer editar. O OCR torna uma digitalização pesquisável, não editável. Cada página continua uma imagem com texto por trás, então não dá para redigitar uma frase no lugar.

As páginas são renderizadas e lidas dentro desta aba do navegador. Os únicos downloads extras são os modelos de idioma, buscados em pd00.com, e nem a sua digitalização nem o texto dela são enviados a lugar nenhum; veja como conferir.

Perguntas frequentes

Como deixar um PDF digitalizado pesquisável?

Adicione o PDF aqui, marque o idioma em que ele está escrito e clique em Tornar pesquisável. O PDF que você baixa tem uma camada de texto invisível, então Ctrl+F (Cmd+F no Mac) encontra palavras nas páginas digitalizadas.

O OCR muda a aparência das páginas?

Não. As palavras reconhecidas ficam invisíveis sobre a imagem original de cada página, então o documento fica idêntico em qualquer leitor de PDF.

Posso converter um PDF digitalizado em texto?

Sim. Junto com o PDF pesquisável, a ferramenta oferece as palavras reconhecidas num arquivo .txt. Confira nomes, números e valores com a digitalização, porque o OCR pode ler caracteres errado.

Quais idiomas ele reconhece?

Português, inglês, espanhol, francês, alemão, italiano, chinês (simplificado), chinês (tradicional), japonês e coreano. Dá para combinar até três. Cada modelo de idioma é baixado uma vez de pd00.com e fica no cache do navegador.

Ele lê letra à mão?

Não com confiabilidade. O Tesseract foi feito para texto impresso e digitado, então palavras escritas à mão muitas vezes saem erradas ou são puladas.

A minha digitalização é enviada a um servidor para o reconhecimento?

Não. O Tesseract roda na aba do navegador e o PDF fica no seu aparelho; só os modelos de idioma são baixados, de pd00.com. Veja como conferir isso.

Atualizado em