VelloDoc
Numérisation et OCR

Comment rendre interrogeable un PDF numérisé en ourdou grâce à l’OCR

Les documents en ourdou circulent souvent sous forme de numérisations : actes judiciaires, dossiers scolaires, courriers administratifs, coupures de presse et livres anciens. Une numérisation ne peut être ni fouillée ni copiée tant que son texte n’est pas reconnu. L’ourdou ajoute une difficulté particulière : la plupart des textes imprimés en ourdou utilisent le style nastaliq, dont les lettres inclinées et superposées sont bien plus difficiles à lire pour un logiciel que le style naskh, droit, courant dans l’imprimerie arabe. Ce guide explique ce qu’on peut attendre de l’OCR de l’ourdou, comment préparer les pages et comment tirer le meilleur parti du résultat.

Par VelloDocMis à jour le Temps de lecture : 7 min

Essayez maintenant : OCR PDF

Reconnaissez les mots des pages numérisées et ajoutez une couche de texte invisible pour pouvoir rechercher et copier dans le PDF.

Ouvrir la page complète : OCR PDF

Choisir des fichiers

Déposez les fichiers ici ou cliquez pour parcourir


Formats acceptés : PDFMax. 80 MoSupprimé après livraison

Reconnaît 39 langues, deux à la fois. Vérifiez le texte reconnu avant de vous y fier.

Le nastaliq et son importance pour l’OCR

Le nastaliq est un style fluide et calligraphique. Au lieu de reposer sur une ligne plate, les lettres d’un mot descendent en pente de droite à gauche, les lettres liées s’empilent et se chevauchent, et les points se serrent dans les petits espaces qui les séparent. Les mots sont souvent formés de plusieurs groupes distincts de lettres liées, si bien que les espaces à l’intérieur d’un mot peuvent ressembler aux espaces entre les mots. Chacune de ces caractéristiques complique la tâche d’un moteur d’OCR pour séparer les lettres, conserver leurs points et déterminer où les mots commencent et finissent. Les documents imprimés avec une police ourdoue de style naskh, utilisée par certains formulaires et documents numériques, sont généralement mieux reconnus que l’imprimé nastaliq traditionnel. Il est utile de savoir quel style vous avez avant de juger les résultats.

Comment fonctionne l’OCR de l’ourdou sur VelloDoc

OCR PDF utilise le moteur open source Tesseract avec ses données de langue ourdoue. Quand vous choisissez l’ourdou, chaque page est dessinée à environ 250 ppp, les mots sont reconnus, puis le texte reconnu est posé de façon invisible sur la page d’origine : la page garde le même aspect mais peut être fouillée et copiée. Dans ce guide, l’outil ci-dessus démarre avec l’ourdou déjà sélectionné. Choisissez l’ourdou plutôt que l’arabe pour les documents en ourdou : l’ourdou utilise des lettres que l’arabe n’a pas, comme ٹ, ڈ, ڑ, ں et ے, et les données ourdoues sont construites à partir de mots ourdous. Si un document en ourdou contient des mots anglais, ajoutez l’anglais comme deuxième langue pour que les deux écritures soient reconnues.

Préparer des numérisations en ourdou

Les détails fins et serrés du nastaliq sont les premiers qu’une mauvaise numérisation détruit : donnez au moteur toute la netteté possible. Numérisez les pages imprimées à 300 ppp ou plus en niveaux de gris, gardez les pages bien à plat pour que les lignes ne se courbent pas près de la reliure, et nettoyez la vitre du scanner. Au téléphone, photographiez chaque page bien de face sous une lumière uniforme, remplissez le cadre avec le papier et évitez les ombres. Ne compressez pas les numérisations avant la reconnaissance : une forte compression JPEG brouille les points et les liaisons qui distinguent les lettres. Lancez l’OCR sur la meilleure version dont vous disposez, puis compressez le fichier final s’il doit être plus léger.

Un ordre d’étapes fiable

Pour une pile de pages numérisées, une bonne séquence est la suivante : regroupez les photos prises au téléphone dans un seul fichier avec Numériser en PDF, ou partez du PDF de votre scanner ; retirez les versos vides des numérisations recto verso avec Supprimer les pages blanches ; redressez les pages inclinées avec Redresser un PDF ; puis lancez l’OCR. Respectez cet ordre, car des lignes d’écriture ourdoue bien horizontales sont reconnues de façon bien plus fiable que des lignes inclinées. Enfin, vérifiez le résultat et, si nécessaire, réduisez sa taille avec Compresser PDF.

Vérifier et modifier le texte ourdou reconnu

Recherchez dans le résultat quelques mots visibles sur la page. Attendez-vous à ce que certaines recherches échouent même quand le mot est présent, car une seule lettre mal lue suffit à rompre la correspondance. Vérifiez soigneusement les noms, les nombres et les dates ; les documents en ourdou peuvent utiliser des chiffres arabes orientaux, dont la reconnaissance peut varier. Pour modifier le texte, PDF en Word le récupère sous forme de document modifiable et PDF en TXT l’enregistre en texte brut. Ouvrez l’un ou l’autre dans un logiciel qui prend en charge le texte ourdou de droite à gauche, et prévoyez du temps pour les corrections. Les visionneuses traitent différemment le texte de droite à gauche dans les couches invisibles : si le texte copié apparaît dans le désordre, essayez une autre application.

Quand l’OCR n’est pas la bonne réponse

Un OCR généraliste n’est pas conçu pour l’écriture manuscrite, la calligraphie décorative, les doubles au carbone pâles ou les pages très abîmées, et la poésie ourdoue composée dans des styles ornés est particulièrement difficile. Pour ce type de documents, la couche interrogeable peut encore aider à trouver la bonne page, mais le texte lui-même n’est pas fiable. Si la précision est essentielle, par exemple pour une citation juridique ou universitaire, comparez les passages reconnus à l’image de la page ou ressaisissez-les. Le guide sur les PDF interrogeables explique les couches de texte, et le guide de l’OCR de l’arabe traite des difficultés voisines de l’imprimé arabe.

Questions fréquentes

Faut-il choisir l’ourdou ou l’arabe pour un texte en ourdou ?

Choisissez l’ourdou. L’ourdou utilise des lettres que l’arabe n’a pas, et les données de langue ourdoue sont construites à partir de mots ourdous.

Pourquoi mon texte ourdou reconnu contient-il autant d’erreurs ?

L’imprimé nastaliq est difficile pour les moteurs d’OCR, et les petits caractères, une faible résolution, l’inclinaison et le bruit ajoutent des erreurs. Renumérisez à 300 ppp ou plus, redressez les pages avec Redresser un PDF et vérifiez soigneusement le résultat.

Puis-je modifier le texte ourdou après l’OCR ?

Oui. Extrayez-le avec PDF en Word ou PDF en TXT et modifiez-le dans un logiciel qui prend en charge le texte de droite à gauche. Attendez-vous à corriger quelques erreurs de reconnaissance.

L’OCR fonctionne-t-il sur l’ourdou manuscrit ?

En général, non. Les données de langue sont conçues pour le texte imprimé : l’écriture manuscrite donne des résultats peu fiables.

Mon document est-il conservé après l’OCR ?

Non. Le fichier est traité dans un dossier de tâche temporaire puis supprimé une fois le résultat livré. La page sur la sécurité des fichiers donne les détails.

Outils pour ce sujet