Por qué el árabe es más difícil para el OCR
El árabe se escribe de derecha a izquierda con una escritura enlazada, así que la mayoría de las letras se unen a las contiguas y adoptan una forma distinta al principio, en medio o al final de una palabra, o cuando van aisladas. Varias letras comparten la misma forma básica y solo se diferencian por el número y la posición de sus puntos, como ب, ت y ث, de modo que una mota de polvo o un punto perdido pueden cambiar una palabra. Muchos textos omiten además los signos de las vocales breves, mientras que los textos religiosos, poéticos y educativos pueden incluirlos por completo, añadiendo pequeños signos encima y debajo de la línea. Los números y las palabras en alfabeto latino van de izquierda a derecha dentro de frases que van de derecha a izquierda. Un motor de OCR tiene que separar las letras enlazadas, conservar cada punto y cada signo y volver a ponerlo todo en el orden correcto, y por eso la calidad del escaneo importa todavía más en árabe que en inglés.
Cómo reconoce VelloDoc el texto árabe
OCR PDF usa el motor de código abierto Tesseract con sus datos de idioma árabe. Cuando eliges árabe como idioma de OCR, cada página se dibuja a unos 250 DPI, Tesseract localiza sus palabras y el texto reconocido se coloca de forma invisible sobre las palabras de la página original. La página se ve igual, pero ahora puedes buscar, seleccionar y copiar su texto. En esta guía, la herramienta de arriba empieza con el árabe ya seleccionado. En un documento que mezcla árabe e inglés, elige árabe y añade inglés como segundo idioma para que se reconozcan ambos. Las páginas que ya contienen texto seleccionable se dejan tal cual, así que en un archivo mixto solo se leen las escaneadas.
Escanear documentos en árabe para reconocerlos mejor
Parte de la página más nítida y lisa que puedas conseguir. En un escáner, 300 DPI en escala de grises es una buena opción por defecto para árabe impreso; la letra muy pequeña o el texto con todos los signos vocálicos pueden beneficiarse de una resolución mayor, siempre que el resultado siga siendo nítido. Aunque las páginas se vuelven a dibujar a unos 250 DPI para el reconocimiento, un original limpio sigue importando, porque el desenfoque, el ruido y las sombras se arrastran. Con el móvil, llena el encuadre con la página, sujeta la cámara paralela al papel y usa una luz uniforme sin sombras sobre el texto. Escanear a PDF combina fotos del móvil en un solo PDF, pero no detecta los bordes de la página ni corrige la perspectiva, así que recorta y endereza antes las fotos. La guía para escanear mejor con el móvil explica la iluminación y el encuadre en detalle.
Endereza las páginas antes del OCR
Las líneas inclinadas confunden el reconocimiento, y las letras árabes enlazadas son especialmente sensibles porque el motor sigue la línea sobre la que se apoyan. Enderezar PDF detecta el ángulo de cada página y la endereza automáticamente. El orden importa: Tesseract lee las líneas rectas con mucha más fiabilidad que las inclinadas, así que endereza primero y ejecuta después el OCR sobre el archivo enderezado. Si un documento tiene reversos en blanco de un escaneo a doble cara, quítalos antes del reconocimiento con Eliminar páginas en blanco, lo que ahorra tiempo y evita páginas vacías en el resultado.
Revisar y reutilizar el texto reconocido
Abre el resultado y busca algunas palabras que veas en la página, como un nombre o un lugar. Si la búsqueda las encuentra, la capa de texto funciona. Después revisa los detalles que más importan, porque los errores del OCR rara vez son evidentes: letras parecidas que solo se diferencian por los puntos, letras finales como ة y ه o ي y ى, fechas y números. Los distintos visores de PDF tratan de forma diferente el texto de derecha a izquierda en una capa invisible, así que el texto copiado puede aparecer desordenado en algunas aplicaciones; probar otro visor suele ayudar. Para trabajar con el propio texto, PDF a TXT lo guarda como archivo de texto plano que puedes abrir en cualquier editor compatible con el árabe, y PDF a Word lo recupera como documento editable sin el diseño original.
Documentos con los que el OCR tendrá problemas
Hay material que sencillamente supera lo que un OCR de uso general lee con fiabilidad. La escritura a mano, la caligrafía decorativa, los impresos muy antiguos o dañados y las fotocopias tenues suelen producir muchos errores o ningún texto. Los sellos y las firmas sobre el texto ocultan letras, las tablas y los diseños a varias columnas pueden leerse en un orden equivocado, y el texto totalmente vocalizado puede perder o descolocar sus signos. Con documentos así, la capa buscable aún puede ayudarte a encontrar la página correcta, pero los pasajes importantes deben cotejarse con la imagen o volver a teclearse. La guía sobre PDF buscables explica las capas de texto y cuándo el OCR es la herramienta adecuada.
Preguntas
¿VelloDoc puede leer escritura árabe a mano?
No de forma fiable. Los datos del idioma árabe están pensados para texto impreso, así que la escritura a mano suele producir muchos errores o ningún texto.
¿Por qué el texto árabe copiado se ve invertido o roto?
Los visores de PDF tratan de forma distinta el texto de derecha a izquierda en las capas de texto invisibles. Prueba otro visor, o extrae el texto con PDF a TXT y ábrelo en un editor compatible con el árabe.
¿Elijo árabe o inglés para un documento mixto?
Elige árabe y añade inglés como segundo idioma. Así se usan los dos a la vez y las palabras en inglés del documento se leen con mucha más fiabilidad.
¿El OCR cambia el aspecto de mis páginas?
No. Las páginas conservan su propia imagen y el texto reconocido se añade encima como una capa invisible. Las páginas que ya contienen texto seleccionable se dejan tal cual.
¿A qué resolución debo escanear?
300 DPI es una buena opción por defecto para árabe impreso. La letra muy pequeña o el texto con todos los signos vocálicos pueden beneficiarse de una resolución mayor, siempre que el escaneo siga siendo nítido.