↑ ↓ para moverte · Enter para abrir · Esc para cerrar

Aplica OCR a un PDF escaneado para poder buscar en él

Añade a un PDF escaneado una capa oculta de texto real para poder buscar, seleccionar y copiar sus palabras. El reconocimiento se hace en tu propio dispositivo y cada página conserva exactamente su aspecto.

Funciona en tu dispositivo: los archivos nunca se suben. Cómo comprobarlo

Suelta aquí un PDF o elige archivos Un PDF cada vez
Idioma del texto (hasta 3)

Acerca de la herramienta OCR de PDF

Un escáner o una app de escaneo del teléfono guarda cada hoja como una imagen. Un visor de PDF solo ve píxeles, así que buscar un nombre no da ningún resultado y al arrastrar el cursor se selecciona la página entera en lugar de una frase. El reconocimiento óptico de caracteres (OCR) analiza esos píxeles y deduce qué letras muestran.

En esta página, cada página de tu archivo se dibuja a 300 DPI con pdf.js y se pasa a Tesseract, el motor de OCR de código abierto, en su versión para navegador tesseract.js (licencia Apache-2.0). Las palabras que reconoce se vuelven a escribir en el PDF como una capa de texto invisible, colocada sobre los puntos correspondientes de la página original. La página visible no se toca: el escaneo, sus colores, sellos y firmas se ven igual que antes. Lo que cambia es que ahora el documento responde a las búsquedas y puedes resaltar y copiar texto como en cualquier PDF creado en una computadora. Si solo quieres las palabras, todo lo reconocido se ofrece también como un archivo .txt de texto sin formato.

Idiomas de reconocimiento

Tesseract lee con más precisión cuando sabe qué idioma esperar. El español viene seleccionado de forma predeterminada. También están disponibles inglés, francés, alemán, portugués, italiano, chino (simplificado), chino (tradicional) y japonés. Cada modelo de idioma es una descarga de entre 0,7 y 3 MB, aproximadamente, desde pd00.com la primera vez que lo eliges; tu navegador lo guarda en caché para las siguientes veces.

Cómo usar la herramienta OCR de PDF

  1. Elige el PDF escaneadoSelecciona el archivo o arrástralo sobre la herramienta. Un escaneo protegido con contraseña tiene que pasar antes por Desbloquear PDF, y ese paso requiere la propia contraseña.
  2. Indica qué idiomas debe leerEn «Idioma del texto (hasta 3)», deja marcado «Español» o marca los idiomas en que está escrito el documento, hasta tres para páginas que los mezclan.
  3. Reconoce y descargaPulsa «Hacer buscable» y deja la pestaña abierta mientras recorre las páginas. Después guarda el PDF con texto buscable y, si solo quieres las palabras, también el archivo .txt.

Cuándo se usa

  • Encontrar una cláusula en un contrato firmado

    Un contrato firmado te llegó de vuelta escaneado. Después del OCR, buscar el nombre de una de las partes o la palabra rescisión te lleva directamente al párrafo correcto, en lugar de pasar por decenas de imágenes.

  • Documentos en papel que querrás encontrar dentro de años

    Las facturas, las tarjetas de garantía y las cartas que escaneas para guardarlas se pueden encontrar por lo que dicen, y no solo por el nombre de archivo, una vez que cada una lleva una capa de texto que la búsqueda de archivos de tu computadora puede indexar.

  • Citar un capítulo fotocopiado

    Un capítulo de libro o un artículo de revista escaneado en el material de lectura de un curso no se puede citar sin volver a teclearlo. Con OCR seleccionas el pasaje, lo copias y luego lo comparas con la imagen de la página para detectar caracteres mal leídos.

De qué depende la precisión del texto

El OCR solo puede leer lo que muestra el escaneo, así que el original importa más que cualquier ajuste. Los mejores resultados salen de páginas capturadas a 300 DPI, bien rectas, con letra oscura sobre fondo claro. La precisión baja con:

  • Baja resolución o desenfoque. Renderizar a 300 DPI no puede recuperar el detalle que un escaneo de baja resolución nunca captó, y la letra pequeña de una foto movida tomada con el teléfono tiene muy pocos píxeles por letra.
  • Páginas torcidas o de lado. Las líneas inclinadas y la curvatura junto al lomo de un libro deforman las palabras. Antes de empezar, endereza con Rotar PDF las páginas que estén de lado.
  • Escritura a mano. Tesseract está pensado para texto impreso y mecanografiado. Las notas manuscritas, las firmas y las casillas rellenadas a mano no se reconocen de forma fiable.
  • Un idioma que falta. Una carta en alemán leída solo con español suele perder sus diéresis y confundir palabras, así que selecciona todos los idiomas que aparecen en las páginas.

Incluso un escaneo limpio tendrá algún error suelto, como un 1 leído como l o rn leído como m. La búsqueda seguirá encontrando la mayoría de las palabras, pero revisa todo lo que copies a un documento importante.

Cuánto tarda el reconocimiento

Cuenta con varios segundos por página en una computadora portátil y más en un teléfono; una carta de dos páginas se termina enseguida, mientras que un informe largo puede llevar minutos, y la pestaña tiene que seguir abierta hasta que acabe. Los archivos largos se procesan mejor en una computadora. Si solo necesitas una sección de un escaneo grande, separa esas páginas con Extraer páginas de PDF y aplica el OCR al archivo más corto.

La opción «Omitir las páginas que ya contienen texto» está marcada de forma predeterminada y ahorra tiempo en documentos mixtos, como un informe mecanografiado con hojas de firmas escaneadas al final: solo se reconocen las páginas sin texto. Desmárcala para que se lean todas las páginas.

Lo que conserva la copia con texto buscable

En la página visible no se limpia, se endereza ni se añade nada, así que el resultado se ve igual en pantalla y en papel que el escaneo que añadiste. El texto añadido es diminuto comparado con esas imágenes, así que el archivo normalmente crece solo un poco. Si además quieres que el PDF ocupe menos, pásalo por Comprimir PDF como paso aparte; para darle un título claro para tu archivo documental, defínelo con Editar metadatos de PDF.

Archivos que no necesitan OCR

  • PDF que ya tienen texto seleccionable. Si puedes resaltar palabras en tu visor, sáltate el OCR y copia las palabras con PDF a texto, o conserva los títulos y las listas con PDF a Markdown.
  • Documentos que quieres editar. El OCR hace que un escaneo sea buscable, no editable. Cada página sigue siendo una imagen con texto detrás, así que no puedes reescribir una frase en su sitio.

Las páginas se renderizan y se leen dentro de esta pestaña del navegador. Las únicas descargas adicionales son los modelos de idioma, que se obtienen de pd00.com, y ni tu escaneo ni su texto se envían a ningún sitio; aquí te explicamos cómo comprobarlo.

Preguntas frecuentes

¿Cómo hago que se pueda buscar en un PDF escaneado?

Añade aquí el PDF, selecciona el idioma en que está escrito y pulsa «Hacer buscable». El PDF que descargas contiene una capa de texto invisible, así que Ctrl+F (Cmd+F en un Mac) encuentra palabras en las páginas escaneadas.

¿El OCR cambiará el aspecto de mis páginas?

No. Las palabras reconocidas quedan invisibles encima de la imagen original de cada página, así que el documento se ve idéntico en cualquier visor.

¿Puedo convertir un PDF escaneado en texto?

Sí. Junto con el PDF buscable, la herramienta ofrece las palabras reconocidas como un archivo .txt. Comprueba los nombres, números e importes con el escaneo, ya que el OCR puede leer mal algunos caracteres.

¿Qué idiomas puede reconocer?

Español, inglés, francés, alemán, portugués, italiano, chino (simplificado), chino (tradicional) y japonés. Puedes combinar hasta tres. Cada modelo de idioma se descarga una sola vez desde pd00.com y tu navegador lo guarda en caché.

¿Puede leer escritura a mano?

No de forma fiable. Tesseract está diseñado para texto impreso y mecanografiado, así que las palabras manuscritas a menudo se leen mal o se pasan por alto.

¿Mi escaneo se sube a un servidor para reconocerlo?

No. Tesseract se ejecuta en la pestaña de tu navegador y el PDF se queda en tu dispositivo; solo se descargan los modelos de idioma, desde pd00.com. Mira cómo verificarlo.

Última actualización: 8 de octubre de 2026