Pourquoi l’arabe est plus difficile pour l’OCR
L’arabe s’écrit de droite à gauche dans une écriture liée : la plupart des lettres se rattachent à leurs voisines et prennent une forme différente au début, au milieu ou à la fin d’un mot, ou lorsqu’elles sont isolées. Plusieurs lettres partagent la même forme de base et ne se distinguent que par le nombre et la position de leurs points, comme ب, ت et ث : une poussière ou un point manquant peut donc changer un mot. Beaucoup de textes omettent aussi les signes des voyelles brèves, tandis que les textes religieux, poétiques et éducatifs peuvent les inclure intégralement, ajoutant de petits signes au-dessus et au-dessous de la ligne. Les nombres et les mots en caractères latins se lisent de gauche à droite au sein de phrases qui vont de droite à gauche. Un moteur d’OCR doit séparer les lettres liées, conserver chaque point et chaque signe, et tout remettre dans le bon ordre : c’est pourquoi la qualité de la numérisation compte encore plus pour l’arabe que pour l’anglais.
Comment VelloDoc reconnaît le texte arabe
OCR PDF utilise le moteur open source Tesseract avec ses données de langue arabe. Quand vous choisissez l’arabe comme langue d’OCR, chaque page est dessinée à environ 250 ppp, Tesseract y repère les mots, puis le texte reconnu est posé de façon invisible sur les mots de la page d’origine. La page garde le même aspect, mais vous pouvez désormais rechercher, sélectionner et copier son texte. Dans ce guide, l’outil ci-dessus démarre avec l’arabe déjà sélectionné. Pour un document qui mélange arabe et anglais, choisissez l’arabe et ajoutez l’anglais comme deuxième langue afin que les deux soient reconnus. Les pages qui contiennent déjà du texte sélectionnable restent telles quelles : dans un fichier mixte, seules les pages numérisées sont lues.
Numériser des documents arabes pour une meilleure reconnaissance
Partez de la page la plus nette et la plus plane possible. Sur un scanner, 300 ppp en niveaux de gris est un bon réglage par défaut pour l’arabe imprimé ; les très petits caractères ou un texte entièrement vocalisé peuvent gagner à une résolution plus élevée, tant que le résultat reste net. Même si les pages sont redessinées à environ 250 ppp pour la reconnaissance, une source propre reste importante, car le flou, le bruit et les ombres se répercutent. Au téléphone, remplissez le cadre avec la page, tenez l’appareil parallèle au papier et utilisez une lumière uniforme sans ombre sur le texte. Numériser en PDF regroupe des photos prises au téléphone dans un seul PDF, mais ne détecte pas les bords de la page et ne corrige pas la perspective : recadrez et redressez vos photos au préalable. Le guide pour des numérisations plus nettes au téléphone détaille l’éclairage et le cadrage.
Redresser les pages avant l’OCR
Les lignes inclinées perturbent la reconnaissance, et les lettres arabes liées y sont particulièrement sensibles, car le moteur suit la ligne sur laquelle elles reposent. Redresser un PDF détecte l’angle de chaque page et la redresse automatiquement. L’ordre compte : Tesseract lit les lignes horizontales de façon bien plus fiable que les lignes inclinées. Redressez d’abord, puis lancez l’OCR sur le fichier redressé. Si un document contient les versos vides d’une numérisation recto verso, retirez-les avant la reconnaissance avec Supprimer les pages blanches, ce qui fait gagner du temps et évite des pages vides dans le résultat.
Vérifier et réutiliser le texte reconnu
Ouvrez le résultat et recherchez quelques mots visibles sur la page, comme un nom ou un lieu. Si la recherche les trouve, la couche de texte fonctionne. Vérifiez ensuite les détails les plus importants, car les erreurs d’OCR sont rarement évidentes : lettres semblables qui ne diffèrent que par leurs points, lettres finales comme ة et ه ou ي et ى, dates et nombres. Les visionneuses PDF traitent différemment le texte de droite à gauche dans une couche invisible : le texte copié peut donc apparaître dans le désordre dans certaines applications, et essayer une autre visionneuse aide souvent. Pour travailler sur le texte lui-même, PDF en TXT l’enregistre dans un fichier texte brut que vous pouvez ouvrir dans tout éditeur prenant en charge l’arabe, et PDF en Word le récupère sous forme de document modifiable, sans la mise en page d’origine.
Les documents qui poseront problème à l’OCR
Certains documents dépassent tout simplement ce qu’un OCR généraliste lit de façon fiable. L’écriture manuscrite, la calligraphie décorative, les imprimés très anciens ou abîmés et les photocopies pâles produisent généralement beaucoup d’erreurs, voire aucun texte. Les tampons et signatures posés sur le texte masquent des lettres, les tableaux et les mises en page en colonnes peuvent être lus dans le mauvais ordre, et un texte entièrement vocalisé peut perdre ou déplacer ses signes. Pour ce type de documents, la couche interrogeable peut encore aider à trouver la bonne page, mais les passages importants doivent être vérifiés sur l’image ou ressaisis. Le guide sur les PDF interrogeables explique les couches de texte et quand l’OCR est le bon outil.
Questions fréquentes
VelloDoc peut-il lire l’arabe manuscrit ?
Pas de façon fiable. Les données de langue arabe sont conçues pour le texte imprimé : l’écriture manuscrite produit généralement beaucoup d’erreurs, voire aucun texte.
Pourquoi le texte arabe copié apparaît-il inversé ou morcelé ?
Les visionneuses PDF traitent différemment le texte de droite à gauche dans les couches de texte invisibles. Essayez une autre visionneuse, ou extrayez le texte avec PDF en TXT et ouvrez-le dans un éditeur qui prend en charge l’arabe.
Faut-il choisir l’arabe ou l’anglais pour un document mixte ?
Choisissez l’arabe et ajoutez l’anglais comme deuxième langue. Les deux sont alors utilisés ensemble, et les mots anglais du document sont lus de façon bien plus fiable.
L’OCR modifie-t-il l’aspect de mes pages ?
Non. Les pages gardent leur propre image, et le texte reconnu est ajouté par-dessus sous forme de couche invisible. Les pages qui contiennent déjà du texte sélectionnable restent telles quelles.
À quelle résolution faut-il numériser ?
300 ppp est un bon réglage par défaut pour l’arabe imprimé. Les très petits caractères ou un texte entièrement vocalisé peuvent gagner à une résolution plus élevée, tant que la numérisation reste nette.