VelloDoc
Escaneo y OCR

¿Qué hace que un PDF se pueda buscar?

Dos PDF pueden verse idénticos en pantalla y comportarse de forma completamente distinta. En uno puedes buscar un nombre, copiar un párrafo y hacer que un lector de pantalla lea la página en voz alta; en el otro no pasa nada, porque la página es solo una imagen de texto. La diferencia es una capa de texto. Esta guía explica qué es una capa de texto, cómo comprobar si un PDF la tiene, cómo el reconocimiento óptico de caracteres la crea a partir de un escaneo y qué determina si el texto reconocido es lo bastante preciso como para fiarse de él.

Por VelloDocActualizado el Tiempo de lectura: 7 min

Pruébalo ahora: OCR PDF

Reconoce las palabras de las páginas escaneadas y añade una capa de texto invisible para poder buscar y copiar en el PDF.

Abrir la página completa de OCR PDF

Elegir archivos

Suelta los archivos aquí o haz clic para buscarlos


Acepta: PDFMáx. 80 MBEliminado tras la entrega

Reconoce 39 idiomas, dos a la vez. Revisa el texto reconocido antes de fiarte de él.

Capas de texto frente a imágenes de texto

Un PDF creado desde un procesador de textos, una hoja de cálculo o un navegador guarda el texto como caracteres: cada letra se registra con su fuente, su tamaño y su posición en la página. Como el archivo sabe qué caracteres contiene, los visores pueden buscarlos, seleccionarlos, copiarlos y pasárselos a las tecnologías de apoyo. Un escáner o la cámara de un móvil funcionan de otra manera. Registran una imagen de la página, una cuadrícula de píxeles de colores que no tiene ni idea de que algunos de esos píxeles forman la palabra «factura». El resultado puede verse perfectamente nítido sin contener texto alguno. Muchos documentos reales mezclan ambos tipos de página: un contrato generado digitalmente con una página de firmas escaneada al final, o un informe con anexos fotografiados. Por eso la búsqueda a veces encuentra una palabra en la página 3 pero no en la 12, aunque puedas leerla perfectamente en ambas.

Cómo comprobar un PDF en diez segundos

La prueba más rápida es intentar seleccionar una palabra. Si las palabras se resaltan al arrastrar, la página tiene capa de texto. Si en cambio el cursor dibuja un rectángulo sobre la página, estás viendo una imagen. Una segunda prueba es buscar una palabra que veas; si no hay coincidencias con una palabra visible, esa página no tiene texto utilizable. Ampliar es una tercera pista útil: el texto real se mantiene nítido a cualquier aumento, mientras que el texto de una imagen se vuelve borroso y pixelado. En documentos mixtos, comprueba varias páginas y no solo la primera. Si quieres ver exactamente qué texto contiene un PDF, PDF a TXT lo extrae; un archivo que sale vacío, o vacío en ciertas páginas, te está diciendo dónde falta la capa de texto.

Qué hace realmente el OCR

El reconocimiento óptico de caracteres convierte imágenes de texto de nuevo en caracteres. El programa localiza las líneas de texto de una página, las separa en palabras y letras, y compara las formas que ve con un modelo entrenado de un idioma, eligiendo los caracteres y palabras más probables. El resultado no es solo una secuencia de texto, sino texto con posiciones, de modo que cada palabra reconocida se puede colocar exactamente sobre su imagen. OCR PDF usa el motor Tesseract. Cada página se dibuja a unos 250 DPI y se reconoce, y el texto reconocido se coloca de forma invisible sobre la página original, que conserva su propia imagen. Esta disposición se suele llamar PDF sándwich. Cuando buscas, el visor encuentra la palabra oculta y resalta el punto donde aparece la palabra visible, así que la página se ve igual pero se comporta como un documento digital.

Por qué importa el ajuste de idioma

Los motores de OCR no reconocen las letras de forma aislada. Se apoyan en modelos de idioma que saben qué caracteres existen, cómo se combinan y qué palabras son probables. Elegir el idioma correcto mejora muchísimo la precisión: un modelo de inglés que lee una carta en francés destrozará los caracteres acentuados y leerá mal las palabras que no espera, y un modelo de escritura latina no puede leer árabe ni urdu en absoluto, porque esas escrituras usan caracteres distintos y se escriben de derecha a izquierda. VelloDoc ofrece 39 idiomas, entre ellos árabe, hebreo, hindi, chino, japonés y coreano, y cada uno necesita sus datos de idioma instalados en el servidor. En documentos que mezclan idiomas, elige el principal y añade el otro como segundo idioma. Si un idioma no está instalado, la herramienta lo indica en lugar de devolver un PDF sin una capa de texto utilizable.

Obtener buenos resultados con escaneos

La mayoría de los errores de OCR se deciden al capturar la página, no al reconocerla. La resolución importa: como regla general, escanear texto impreso normal a unos 300 DPI da al reconocimiento detalle suficiente, y la letra muy pequeña se beneficia de más. El contraste también importa, así que el texto oscuro sobre papel blanco y limpio se reconoce mucho mejor que el texto tenue sobre fondos grises o con dibujos. Las líneas rectas importan porque el reconocimiento espera filas de texto niveladas; Enderezar PDF corrige pequeñas inclinaciones antes del reconocimiento. Las páginas en blanco solo añaden tiempo de procesamiento, y Eliminar páginas en blanco las quita. Las sombras, las páginas curvadas junto al lomo de un libro y los reflejos del papel satinado son los problemas más comunes en los escaneos con el móvil; la guía para escanear mejor con el móvil explica cómo evitarlos.

Revisar y corregir el texto reconocido

Hasta un buen OCR comete errores, y esos errores siguen patrones. Se confunden los caracteres parecidos: las letras r y n juntas pueden convertirse en m, el dígito 0 y la letra O se intercambian, y 1, l e I se mezclan con facilidad. El texto de las tablas puede salir en un orden inesperado, y las páginas a varias columnas pueden leerse de un lado a otro en lugar de columna a columna. Los nombres, números de referencia, fechas e importes merecen la máxima atención, porque un solo dígito erróneo cambia su significado sin dejar de parecer verosímil. Una comprobación práctica es buscar en el resultado del OCR varias palabras y cifras que veas en la página. En documentos donde la redacción exacta importa, como los registros legales o financieros, trata el texto reconocido como una comodidad para buscar y confía siempre en la propia imagen de la página como versión de referencia.

Buscable no es lo mismo que accesible

Una capa de texto es un gran avance para la accesibilidad, porque los lectores de pantalla pueden por fin leer en voz alta las palabras de una página escaneada. Pero un PDF plenamente accesible necesita algo más. Los documentos accesibles llevan etiquetas que describen la estructura, como qué texto es un título, cuál es una lista y qué imagen necesita una descripción, y definen un orden de lectura para que las tecnologías de apoyo presenten el contenido en una secuencia lógica. El OCR no añade esas etiquetas. El estándar PDF/UA describe lo que exige la accesibilidad completa. Cuando necesitas un contenido que todo el mundo pueda leer con facilidad, también en el móvil, convertir el PDF buscable en una página web con PDF a HTML es otra vía práctica, porque el texto HTML se adapta a la pantalla y funciona de forma natural con las funciones de accesibilidad del navegador.

Cuando el OCR no es la herramienta adecuada

El OCR es para páginas que son imágenes. VelloDoc deja tal cual las páginas que ya tienen texto, así que ejecutarlo sobre un PDF digital simplemente lo devuelve sin cambios. Hay una excepción importante: algunos PDF digitales contienen texto que se ve normal pero se copia como un galimatías, porque el archivo guarda los caracteres sin información sobre qué letras representan. El OCR lo soluciona leyendo la página visible. Si tienes el documento original, exportar un PDF nuevo desde él siempre es mejor que reconocer un escaneo. Para archivos a largo plazo, un orden razonable es escanear, limpiar, ejecutar el OCR y convertir después el resultado con PDF a PDF/A para que el documento buscable siga siendo legible durante años. La guía de herramientas de optimización muestra cómo encajan estos pasos. Para documentos en escritura árabe, consulta las guías de OCR para PDF en árabe y de OCR para PDF en urdu.

Preguntas

¿Por qué veo el texto pero no puedo buscarlo?

La página es una imagen del texto y no el texto en sí, algo típico de escaneos y fotos del móvil. Ejecuta OCR PDF para añadir una capa de texto buscable.

¿El OCR cambia el aspecto de mi PDF?

No. VelloDoc conserva cada página tal como era y coloca encima las palabras reconocidas como texto invisible.

¿El OCR puede leer escritura a mano?

En general, no de forma fiable. Tesseract está pensado para texto impreso; a veces reconoce mayúsculas de imprenta bien trazadas, pero la letra cursiva normalmente no.

¿El texto del OCR es lo bastante preciso para documentos legales?

Úsalo para encontrar documentos y moverte por ellos, pero verifica nombres, cifras y fechas con la imagen de la página. La imagen sigue siendo el registro de referencia.

¿Debo ejecutar el OCR en un PDF que ya se puede buscar?

No, salvo que su texto se copie como caracteres sin sentido. El OCR en un PDF digital sustituye el texto real por una imagen y una capa de texto oculta.

Herramientas para este tema