VelloDoc
Escaneo y OCR

Cómo hacer buscable un PDF escaneado en urdu con OCR

Los documentos en urdu se comparten a menudo como escaneos: escritos judiciales, expedientes escolares, cartas oficiales, recortes de periódico y libros antiguos. Un escaneo no se puede buscar ni copiar hasta que se reconoce su texto. El urdu añade una dificultad particular, porque la mayor parte del urdu impreso usa el estilo nastaliq, cuyas letras inclinadas y superpuestas son mucho más difíciles de leer para el software que el estilo naskh, recto, habitual en la imprenta árabe. Esta guía explica qué esperar del OCR en urdu, cómo preparar las páginas y cómo sacar el máximo partido al resultado.

Por VelloDocActualizado el Tiempo de lectura: 7 min

Pruébalo ahora: OCR PDF

Reconoce las palabras de las páginas escaneadas y añade una capa de texto invisible para poder buscar y copiar en el PDF.

Abrir la página completa de OCR PDF

Elegir archivos

Suelta los archivos aquí o haz clic para buscarlos


Acepta: PDFMáx. 80 MBEliminado tras la entrega

Reconoce 39 idiomas, dos a la vez. Revisa el texto reconocido antes de fiarte de él.

El nastaliq y por qué importa para el OCR

El nastaliq es un estilo fluido y caligráfico. En lugar de apoyarse sobre una línea plana, las letras de una palabra descienden inclinadas de derecha a izquierda, las letras enlazadas se apilan y se superponen, y los puntos se amontonan en los pequeños espacios que quedan entre ellas. Las palabras suelen estar formadas por varios grupos separados de letras enlazadas, así que los huecos dentro de una palabra pueden parecer los huecos entre palabras. Cada una de estas características hace más difícil que un motor de OCR separe las letras, conserve sus puntos y decida dónde empiezan y terminan las palabras. Los documentos impresos con una fuente urdu de estilo naskh, que usan algunos formularios y documentos digitales, suelen reconocerse mejor que la imprenta nastaliq tradicional. Conviene saber qué estilo tienes antes de juzgar los resultados.

Cómo funciona el OCR en urdu de VelloDoc

OCR PDF usa el motor de código abierto Tesseract con sus datos de idioma urdu. Cuando eliges urdu, cada página se dibuja a unos 250 DPI, se reconocen las palabras y el texto reconocido se coloca de forma invisible sobre la página original, de modo que la página se ve igual pero se puede buscar y copiar. En esta guía, la herramienta de arriba empieza con el urdu ya seleccionado. Elige urdu y no árabe para los documentos en urdu: el urdu usa letras que el árabe no tiene, como ٹ, ڈ, ڑ, ں y ے, y los datos del urdu se basan en palabras en urdu. Si un documento en urdu contiene palabras en inglés, añade inglés como segundo idioma para que se reconozcan ambas escrituras.

Preparar escaneos en urdu

Los detalles pequeños y apretados del nastaliq son lo primero que destruye un mal escaneo, así que dale al motor toda la claridad que puedas. Escanea las páginas impresas a 300 DPI o más en escala de grises, mantén las páginas planas para que las líneas no se curven junto al lomo y limpia el cristal del escáner. Con el móvil, fotografía cada página de frente con luz uniforme, llena el encuadre con el papel y evita las sombras. No comprimas los escaneos antes del reconocimiento: una compresión JPEG fuerte emborrona los puntos y las uniones que distinguen unas letras de otras. Ejecuta el OCR sobre la mejor versión que tengas y comprime después el archivo terminado si tiene que ser más pequeño.

Un orden de pasos fiable

Para un montón de páginas escaneadas, una buena secuencia es: combina las fotos del móvil en un solo archivo con Escanear a PDF, o parte del PDF de tu escáner; quita los reversos vacíos de los escaneos a doble cara con Eliminar páginas en blanco; endereza las páginas torcidas con Enderezar PDF, y después ejecuta el OCR. Mantén este orden, porque las líneas rectas de escritura urdu se reconocen con mucha más fiabilidad que las inclinadas. Por último, revisa el resultado y, si hace falta, reduce su tamaño con Comprimir PDF.

Revisar y editar el texto urdu reconocido

Busca en el resultado algunas palabras que veas en la página. Cuenta con que algunas búsquedas fallen aunque la palabra esté ahí, porque una sola letra mal leída rompe la coincidencia. Revisa con cuidado nombres, números y fechas; los documentos en urdu pueden usar cifras arábigo-índicas orientales, y la forma de reconocerlas puede variar. Para editar el texto, PDF a Word lo recupera como documento editable y PDF a TXT lo guarda como texto plano. Abre cualquiera de los dos en un programa compatible con texto urdu de derecha a izquierda y reserva tiempo para las correcciones. Los distintos visores tratan de forma diferente el texto de derecha a izquierda en capas invisibles, así que si el texto copiado aparece desordenado, prueba otra aplicación.

Cuando el OCR no es la respuesta

El OCR de uso general no está pensado para escritura a mano, caligrafía decorativa, copias de papel carbón tenues ni páginas muy dañadas, y la poesía urdu compuesta en estilos ornamentados es especialmente difícil. Con material así, la capa buscable aún puede ayudarte a encontrar la página correcta, pero el texto en sí no es fiable. Si la precisión es crítica, por ejemplo para citas legales o académicas, coteja los pasajes reconocidos con la imagen de la página o vuelve a teclearlos. La guía sobre PDF buscables explica las capas de texto, y la guía de OCR en árabe trata los retos parecidos de la imprenta árabe.

Preguntas

¿Elijo urdu o árabe para un texto en urdu?

Elige urdu. El urdu usa letras que el árabe no tiene, y los datos del idioma urdu se basan en palabras en urdu.

¿Por qué hay tantos errores en mi texto urdu reconocido?

La imprenta nastaliq es difícil para los motores de OCR, y la letra pequeña, la baja resolución, la inclinación y el ruido añaden errores. Vuelve a escanear a 300 DPI o más, endereza las páginas con Enderezar PDF y revisa el resultado con cuidado.

¿Puedo editar el texto urdu después del OCR?

Sí. Extráelo con PDF a Word o PDF a TXT y edítalo en un programa compatible con texto de derecha a izquierda. Cuenta con corregir algunos errores de reconocimiento.

¿Funciona el OCR con urdu escrito a mano?

En general, no. Los datos del idioma están pensados para texto impreso, así que la escritura a mano da resultados poco fiables.

¿Se guarda mi documento después del OCR?

No. El archivo se procesa en una carpeta de trabajo temporal y se elimina tras entregar el resultado. La página de seguridad de archivos explica los detalles.

Herramientas para este tema