Un PDF escaneado parece un documento, pero se comporta como una fotografía: no puedes buscar en él, copiar una frase ni hacer que un lector de pantalla lo lea en voz alta. El reconocimiento óptico de caracteres lo soluciona. OCR PDF lee las palabras de cada página y las coloca sobre ella como texto invisible, así que se ve exactamente igual pero se puede buscar, seleccionar e indexar. Lee 39 idiomas, dos a la vez para documentos que los mezclan, y también puede darte el texto en un archivo aparte.
Cómo usar OCR PDF
- Añade el PDF escaneado. Endereza antes las páginas torcidas con Enderezar PDF para mejorar la precisión.
- Elige el idioma del documento y un segundo idioma si las páginas mezclan dos.
- Elige PDF con texto buscable o archivo de texto y selecciona Ejecutar OCR.
- Descarga el resultado y compruébalo buscando una palabra que veas en una página.
Cómo se crea la capa buscable
Cada página se dibuja a 250 DPI y el motor Tesseract localiza las palabras en ese dibujo. Después, las palabras se colocan sobre la página original como texto invisible, en las mismas posiciones que las que ves. El escaneo conserva su propia resolución, y el texto real, los dibujos o los enlaces de la página siguen como estaban: solo se añade la capa invisible. Las páginas que ya tienen texto, escrito o de un OCR anterior, se dejan tal cual, así que ejecutar el OCR dos veces no duplica el texto.
Elegir el idioma correcto
El OCR reconoce los caracteres con un modelo de un idioma concreto, así que acertar con el idioma del documento importa más que cualquier otro ajuste. La lista incluye 39 idiomas, entre ellos árabe, chino simplificado y tradicional, griego, hebreo, hindi, japonés, coreano, ruso, tailandés, turco, ucraniano, urdu y vietnamita, además de los principales idiomas europeos. Para documentos que mezclan idiomas, como un contrato en francés con un anexo en inglés, elige un segundo idioma y se usan los dos modelos a la vez. Con el modelo equivocado, una carta en francés leída como inglés pierde los acentos y confunde palabras. Para escaneos en escritura árabe, las guías de OCR en árabe y de OCR en urdu explican cómo preparar el escaneo y qué precisión esperar.
Conseguir resultados precisos
El reconocimiento es tan bueno como el escaneo. Funcionan mejor las páginas rectas, con luz uniforme y buen contraste, y Enderezar PDF ayuda cuando están inclinadas. La letra pequeña, la escritura a mano, los sellos sobre el texto y los diseños en varias columnas son donde aparecen los errores, así que revisa nombres, cifras y fechas. Elige Archivo de texto para obtener las palabras reconocidas en un .txt, página tras página, o continúa con PDF a Word para un documento editable. La guía sobre PDF buscables explica las capas de texto en detalle.
Cuándo se usa OCR PDF
Archivos de documentos buscables
Haz que años de cartas y extractos escaneados se encuentren por palabra clave en lugar de abrir los archivos uno a uno.
Copiar texto de un escaneo
Selecciona y copia un párrafo, una dirección o un número de referencia de una página escaneada en lugar de volver a teclearlo.
Legible para lectores de pantalla
Una capa de texto permite que los lectores de pantalla lean en voz alta las páginas escaneadas, el primer paso hacia un documento accesible.
Limitaciones que conviene conocer
OCR PDF reconoce texto impreso en 39 idiomas, hasta dos por trabajo, y necesita Tesseract con los datos del idioma en el servidor. Las páginas que ya contienen texto se dejan tal cual. Cuenta con errores en letra pequeña, escritura a mano y diseños complejos, y revisa nombres, cifras y fechas.
OCR PDF: preguntas frecuentes
¿Cómo sé si mi PDF necesita OCR?
Intenta seleccionar una palabra con el cursor o busca una palabra que veas. Si no se encuentra nada, o solo puedes dibujar un recuadro sobre la página, el texto forma parte de una imagen y el OCR te ayudará.
¿El OCR cambia el aspecto del documento?
No. Cada página se conserva tal como era, con su calidad de imagen, y las palabras reconocidas se añaden encima como texto invisible.
¿Puede el OCR leer escritura a mano?
Tesseract está pensado para texto impreso. A veces reconoce mayúsculas de imprenta bien trazadas, pero la letra cursiva normalmente no, así que no te fíes del OCR para notas manuscritas.
¿Puedo obtener solo el texto?
Sí. Elige Archivo de texto como resultado y las palabras reconocidas llegan en un archivo .txt, página a página. Las páginas que ya tenían texto aportan ese texto tal cual.
¿Por qué el OCR dice que un idioma no está instalado?
Cada idioma necesita sus datos de Tesseract en el servidor. Si faltan, VelloDoc lo indica en lugar de devolver un archivo sin capa de texto.