↑ ↓ para moverte · Enter para abrir · Esc para cerrar

Extrae el texto de un PDF

Saca las palabras de un PDF y luego cópialas o guárdalas como un archivo .txt de texto plano. La extracción se hace en tu navegador, así que el documento se queda en tu dispositivo.

Funciona en tu dispositivo: los archivos nunca se suben. Cómo comprobarlo

Suelta aquí un PDF o elige archivos Un PDF cada vez

Acerca de la herramienta PDF a texto

La mayoría de los PDF creados desde un procesador de textos, una página web o una hoja de cálculo contienen texto real: caracteres con su posición, guardados junto al diseño visual. Esta herramienta lee esa capa de texto con pdf.js, la biblioteca de PDF de código abierto de Mozilla, y te la devuelve como texto plano. Obtienes una vista previa en pantalla con un botón Copiar texto, y puedes guardarlo todo como un archivo .txt UTF-8 que se abre en cualquier editor de texto.

Antes del texto de cada página, el resultado inserta una línea de marca como --- Page 3 ---, para que sepas de dónde viene cada pasaje o puedas borrar las páginas que no necesitas. Como el archivo es UTF-8, las letras con tilde, la ñ, el griego, el cirílico, el chino, el japonés y otras escrituras llegan intactos, siempre que el PDF los guarde como caracteres auténticos. Las propiedades del documento, como el título y el autor, no se incluyen; solo el texto de las páginas.

Los PDF escaneados salen vacíos

Un PDF generado por un escáner o por la cámara de un teléfono suele ser solo una pila de fotos de páginas. Dentro no hay caracteres que extraer, así que el resultado sale en blanco. Para leer texto de imágenes hace falta OCR (reconocimiento óptico de caracteres). Esta herramienta no lo hace por sí misma, pero OCR de PDF, en este mismo sitio, sí, también dentro de tu navegador. Una prueba rápida antes de empezar: abre el PDF en cualquier visor e intenta resaltar una palabra. Si el resaltado se ajusta a las letras, la capa de texto existe.

Cómo usar la herramienta PDF a texto

  1. Añade tu PDFSelecciona un PDF de tu dispositivo o arrástralo a la herramienta. Si el archivo pide contraseña, hay que desbloquearlo antes de poder leer su texto.
  2. Revisa el texto extraídoPulsa «Extraer texto» y el texto aparece en la vista previa, página a página, separado por líneas --- Page N ---. Échale un vistazo para asegurarte de que el orden de lectura tiene sentido.
  3. Cópialo o guarda un archivo .txtPulsa «Copiar texto» para llevar todo el texto al portapapeles, o descárgalo como un archivo de texto UTF-8 en el que puedes buscar, editar o copiar para pegarlo en otro sitio.

Cuándo se usa

  • Citar un pasaje sin volver a teclearlo

    ¿Necesitas un párrafo de un contrato, un estudio o un manual de usuario para un correo o un informe? Extrae el texto, localiza la página correcta por su marca y pega solo la parte que necesitas.

  • Buscar en documentos largos o compararlos

    En un archivo .txt se puede buscar con cualquier editor, compararlo línea a línea con un borrador anterior mediante una herramienta de diferencias, o cargarlo en una hoja de cálculo o un script para contar y ordenar.

  • Pasar las palabras a otra app

    Las herramientas de traducción, las apps de notas y los asistentes de chat aceptan texto plano con más facilidad que un PDF. Pegar el texto extraído te permite compartir solo el pasaje que elijas en lugar de subir el archivo original completo.

Orden de lectura y diseño

El texto sale en el orden en que está guardado dentro del PDF, que normalmente, aunque no siempre, coincide con el orden en que lo leería una persona. Los documentos de una sola columna, como cartas, informes y la mayoría de los libros electrónicos, se extraen limpiamente. Los diseños con dos o tres columnas, barras laterales, pies de foto o cuadros de texto flotantes pueden intercalarse: una línea de la columna izquierda seguida de una de la derecha, o un pie de foto que cae en medio de un párrafo.

El formato no forma parte del texto plano. La negrita, la cursiva, los tamaños de fuente, los colores y las imágenes se pierden, y las tablas se convierten en series de palabras separadas por espacios o saltos de línea en lugar de celdas ordenadas. Cuando el aspecto de la página importa más que los caracteres, una imagen de PDF a PNG conserva el diseño exacto, aunque en píxeles.

Por qué no hay ajuste de resolución

Los convertidores de página a imagen de pd00 piden 72, 150 o 300 DPI porque dibujan cada página como una cuadrícula de píxeles. La extracción de texto no dibuja nada. Lee directamente los caracteres guardados, así que no hay resolución que elegir ni pérdida de calidad: lo que obtienes es exactamente el texto que contiene el PDF. El archivo resultante también es ligero, ya que un .txt solo contiene caracteres, sin fuentes ni imágenes, y a menudo es mucho más pequeño que el PDF del que procede.

Cuando el resultado se ve mal

  • No sale nada. El PDF es un escaneo o una exportación de imágenes. Aquí solo puede ayudar el OCR. Pasa antes el archivo por OCR de PDF, que añade una capa de texto oculta, y luego extrae el texto con esta herramienta.
  • Símbolos raros en lugar de palabras. Algunos PDF incrustan fuentes sin una correspondencia entre las formas dibujadas y los caracteres reales. La página se ve bien en pantalla, pero los códigos guardados no significan nada fuera de esa fuente, así que las palabras solo se pueden recuperar con OCR.
  • Palabras partidas o pegadas. Los PDF colocan el texto en fragmentos según su posición, así que pueden aparecer espacios de más o de menos, sobre todo en párrafos justificados o en títulos con letras espaciadas.
  • El archivo está bloqueado. Quita la contraseña con Desbloquear PDF (tienes que conocerla) y luego extrae el texto.

¿Solo necesitas una parte del documento?

La herramienta de texto trabaja con el archivo completo. Si de un manual de 400 páginas solo quieres un capítulo, sepáralo primero con Extraer páginas de PDF o Dividir PDF y luego pasa ese PDF más corto por aquí.

Tu texto sigue siendo privado

El PDF se analiza en la pestaña de tu navegador y el texto se genera en tu dispositivo; ni el archivo ni las palabras extraídas se suben a ningún sitio. Eso importa en contratos, informes médicos y otros papeles confidenciales. Sigue los pasos de la página de privacidad para confirmarlo.

Preguntas frecuentes

¿Cómo copio todo el texto de un PDF?

Añade aquí el PDF, pulsa Extraer texto y, cuando aparezca el texto, pulsa Copiar texto. Todo pasa a tu portapapeles, incluidas las marcas de página.

¿Por qué el texto extraído sale vacío?

Casi seguro que el PDF no tiene capa de texto, algo típico de los escaneos y de las páginas fotografiadas. Prueba a resaltar una palabra en tu visor de PDF: si no se selecciona nada, no hay texto que extraer. Pásalo antes por la herramienta OCR de PDF para añadir una capa de texto buscable y luego vuelve aquí.

¿Por qué se mezclan las dos columnas?

La herramienta sigue el orden en que el texto está guardado en el archivo. En los diseños de varias columnas, ese orden puede saltar de una columna a otra, así que pueden alternarse líneas de columnas distintas.

¿Se conservan las tablas, las imágenes y el formato?

No. Un archivo .txt solo contiene caracteres, así que los estilos y las imágenes se omiten, y las celdas de las tablas se convierten en palabras separadas por espacios o saltos de línea.

¿Para qué sirven las líneas «--- Page N ---»?

Marcan dónde empieza cada página, lo que te ayuda a localizar la página de la que procede una cita. Si no las quieres, bórralas con la función de buscar y reemplazar de tu editor.

¿Funciona con texto en español y otros idiomas?

Sí, siempre que el PDF guarde caracteres Unicode correctos. El resultado está en UTF-8, que cubre todos los sistemas de escritura principales, desde las letras latinas con tilde hasta el chino y el japonés.

¿Se sube mi documento cuando extraigo el texto?

No. La extracción se ejecuta por completo en tu navegador, y el texto nunca sale de tu dispositivo a menos que tú mismo lo pegues en algún sitio. Mira cómo verificarlo.

Última actualización: 8 de octubre de 2026