# Extraia o texto de um PDF

Tire as palavras de um PDF e depois copie-as ou salve-as como um arquivo .txt simples. A extração acontece no seu navegador, então o documento fica no seu aparelho.

## Em resumo

Um PDF exportado de um processador de texto ou de uma página da web guarda as palavras como caracteres de verdade, e o pd00 os lê com o pdf.js e salva um arquivo `.txt` em UTF-8 com uma linha `--- Page N ---` antes de cada página. O UTF-8 codifica qualquer caractere Unicode em 1 a 4 bytes, então acentos, cirílico e chinês chegam intactos. Páginas digitalizadas não têm caracteres e saem vazias.

## Passo a passo: PDF para texto

1. **Adicione o PDF**  
   Selecione um PDF do seu aparelho ou arraste-o para a ferramenta. Um arquivo que pede senha precisa ser desbloqueado antes que o texto possa ser lido.
2. **Confira o texto extraído**  
   Clique em “Extrair texto” e o texto aparece na prévia, página por página, separado por linhas --- Page N ---. Dê uma olhada para garantir que a ordem de leitura faz sentido.
3. **Copie ou salve um arquivo .txt**  
   Clique em “Copiar texto” para levar todo o texto para a área de transferência, ou baixe tudo como um arquivo de texto UTF-8 que você pode pesquisar, editar ou colar em outro lugar.

## Um exemplo na prática

Um contrato de aluguel de 3 páginas, `contrato.pdf`: as páginas 1 e 2 foram digitadas em um processador de texto, e a página 3 é a folha assinada à mão e digitalizada. A extração gera `contrato.txt`, em que `--- Page 1 ---` e `--- Page 2 ---` vêm seguidas dos seus parágrafos e `--- Page 3 ---` não vem seguida de nada, porque uma digitalização não guarda caracteres.

Nesse arquivo UTF-8, o nome do inquilino, “José”, ocupa 5 bytes: um para cada J, o e s, e dois para o é.

## O que a ferramenta faz e quais são os limites

- Lê só uma camada de texto que já exista. Passe digitalizações antes pelo [OCR em PDF](https://pd00.com/pt/ocr-pdf/) e depois extraia.
- Sempre abrange o PDF inteiro, um arquivo por vez; separe um capítulo antes com o [Extrair páginas](https://pd00.com/pt/extrair-paginas-pdf/).
- O texto segue a ordem em que está guardado no arquivo, então páginas em duas colunas e boxes laterais podem sair intercalados.
- Fontes, imagens e células de tabela se perdem; para títulos e listas, use o [PDF para Markdown](https://pd00.com/pt/pdf-para-markdown/).

## Fontes

- [PDF.js](https://mozilla.github.io/pdf.js/), Mozilla
- [RFC 3629: UTF-8, a transformation format of ISO 10646](https://www.rfc-editor.org/rfc/rfc3629), RFC Editor

Links verificados em 10 de outubro de 2026.

## PDF para texto: como funciona

A maioria dos PDFs criados a partir de um processador de texto, de uma página da web ou de uma planilha contém texto de verdade: caracteres com posição, guardados junto com o layout visual. Esta ferramenta lê essa camada de texto com o pdf.js, a biblioteca de PDF de código aberto da Mozilla, e devolve tudo para você como texto simples. Você vê uma prévia na tela com o botão **Copiar texto** e pode salvar tudo como um arquivo `.txt` em UTF-8, que abre em qualquer editor de texto.

Antes do texto de cada página, o resultado insere uma linha marcadora como `--- Page 3 ---`, para você saber de onde veio um trecho ou apagar as páginas de que não precisa. Como o arquivo é UTF-8, letras acentuadas, grego, cirílico, chinês, japonês e outras escritas chegam intactas, desde que o PDF as guarde como caracteres genuínos. Propriedades do documento, como título e autor, não entram; só o texto das páginas.

### PDFs digitalizados saem vazios

Um PDF gerado por um scanner ou pela câmera do celular costuma ser só uma pilha de fotos de páginas. Não há caracteres dentro para extrair, então o resultado fica em branco. Ler texto em imagens exige OCR (reconhecimento de texto). Esta ferramenta não faz isso sozinha, mas o [OCR em PDF](https://pd00.com/pt/ocr-pdf/) deste site faz, também dentro do seu navegador. Um teste rápido antes de começar: abra o PDF em qualquer leitor e tente selecionar uma palavra. Se a seleção se encaixa nas letras, a camada de texto está lá.

## Quando usar

### Citar um trecho sem redigitar

Precisa de um parágrafo de um contrato, de um estudo ou de um manual para um e-mail ou relatório? Extraia o texto, ache a página certa pelo marcador e cole só a parte de que precisa.

### Pesquisar ou comparar documentos longos

Um arquivo .txt pode ser pesquisado em qualquer editor, comparado linha a linha com uma versão anterior usando uma ferramenta de diff ou aberto em uma planilha ou script para contar e ordenar.

### Passar as palavras para outro app

Ferramentas de tradução, apps de notas e assistentes de chat aceitam texto simples com mais facilidade que um PDF. Colar o texto extraído permite compartilhar só o trecho que você escolher, em vez de enviar o arquivo original inteiro.

## Ordem de leitura e layout

O texto sai na ordem em que está guardado dentro do PDF, que normalmente, mas nem sempre, coincide com a ordem em que uma pessoa leria. Documentos de uma coluna, como cartas, relatórios e a maioria dos e-books, saem limpos. Layouts com duas ou três colunas, boxes laterais, legendas ou caixas de texto flutuantes podem se intercalar: uma linha da coluna da esquerda seguida de uma da direita, ou uma legenda caindo no meio de um parágrafo.

Formatação não faz parte do texto simples. Negrito, itálico, tamanhos de fonte, cores e imagens se perdem, e as tabelas viram sequências de palavras separadas por espaços ou quebras de linha, em vez de células organizadas. Quando a aparência da página importa mais que os caracteres, uma imagem feita com o [PDF para PNG](https://pd00.com/pt/pdf-para-png/) mantém o layout exatamente, só que como pixels.

## Por que não há opção de resolução

Os conversores de página para imagem do pd00 pedem 72, 150 ou 300 DPI porque desenham cada página como uma grade de pixels. A extração de texto não desenha nada. Ela lê diretamente os caracteres guardados, então não há resolução para escolher nem perda de qualidade: você recebe exatamente o texto que o PDF contém. O arquivo resultante também é leve, já que um .txt só guarda caracteres, sem fontes nem imagens, e muitas vezes fica bem menor que o PDF de origem.

## Quando o resultado parece errado

- **Não sai nada.** O PDF é uma digitalização ou uma imagem exportada. Só o OCR resolve. Passe o arquivo antes pelo [OCR em PDF](https://pd00.com/pt/ocr-pdf/), que acrescenta uma camada de texto invisível, e depois extraia o texto com esta ferramenta.
- **Símbolos estranhos no lugar das palavras.** Alguns PDFs embutem fontes sem um mapa que ligue as formas desenhadas aos caracteres reais. A página parece normal na tela, mas os códigos guardados não significam nada fora daquela fonte, então as palavras só podem ser recuperadas com OCR.
- **Palavras quebradas ou grudadas.** Os PDFs posicionam o texto em fragmentos, então podem aparecer espaços a mais ou a menos, principalmente em parágrafos justificados ou em títulos com letras espaçadas.
- **O arquivo está bloqueado.** Tire a senha com o [Remover senha do PDF](https://pd00.com/pt/remover-senha-pdf/) (você precisa saber qual é) e depois extraia.

## Só precisa de parte do documento?

A ferramenta de texto trabalha com o arquivo inteiro. Em um manual de 400 páginas do qual você quer um único capítulo, separe esse capítulo antes com o [Extrair páginas](https://pd00.com/pt/extrair-paginas-pdf/) ou o [Dividir PDF](https://pd00.com/pt/dividir-pdf/) e depois passe o PDF mais curto por aqui.

## Seu texto continua privado

O PDF é analisado na aba do navegador e o texto é gerado no seu aparelho; nem o arquivo nem as palavras extraídas são enviados para lugar nenhum. Isso importa para contratos, laudos médicos e outros papéis confidenciais. Siga os passos da [página de privacidade](https://pd00.com/pt/privacidade/#verify) para confirmar.

## Perguntas frequentes

### Como copiar todo o texto de um PDF?

Adicione o PDF aqui e clique em **Copiar texto** depois que o texto aparecer. Tudo vai para a área de transferência, incluindo os marcadores de página.

### Por que o texto extraído veio vazio?

Quase certamente o PDF não tem camada de texto, o que é típico de digitalizações e páginas fotografadas. Tente selecionar uma palavra no seu leitor de PDF: se nada for selecionado, não há texto para extrair. Passe o arquivo antes pela ferramenta OCR em PDF para acrescentar uma camada de texto pesquisável e depois volte aqui.

### Por que as duas colunas saíram misturadas?

A ferramenta segue a ordem em que o texto está guardado no arquivo. Em layouts de várias colunas, essa ordem pode pular de uma coluna para outra, e linhas de colunas diferentes podem se alternar.

### Tabelas, imagens e formatação são mantidas?

Não. Um arquivo `.txt` só guarda caracteres, então estilos e imagens ficam de fora e as células das tabelas viram palavras separadas por espaços ou quebras de linha.

### Para que servem as linhas “--- Page N ---”?

Elas marcam onde cada página começa, o que ajuda a localizar a página de uma citação. Se não quiser essas linhas, apague-as com a função localizar e substituir do seu editor.

### Funciona com texto em português e em outros idiomas?

Sim, desde que o PDF guarde caracteres Unicode corretos. A saída é UTF-8, que cobre todos os principais sistemas de escrita, das letras latinas acentuadas ao chinês e ao japonês.

### Meu documento é enviado quando eu extraio o texto?

Não. A extração roda inteiramente no seu navegador, e o texto nunca sai do seu aparelho, a não ser que você mesmo o cole em algum lugar. Veja [como verificar isso](https://pd00.com/pt/privacidade/#verify).

Atualizado em 11 de outubro de 2026  
https://pd00.com/pt/pdf-para-texto/
