VelloDoc
Numérisation et OCR

OCR de PDF en arabe en ligne : qualité de numérisation et conseils de précision

Un document arabe numérisé n’est qu’une image de texte : impossible d’y chercher un nom, d’en copier un paragraphe ou de le faire lire par un lecteur d’écran. La reconnaissance optique de caractères retransforme ces images en texte, mais l’arabe pose des difficultés que les écritures latines ne connaissent pas, des lettres liées qui changent de forme aux points et signes qui se perdent facilement dans une numérisation médiocre. Ce guide explique comment l’OCR traite l’arabe, comment préparer les pages pour un meilleur résultat et comment vérifier ce qui a été reconnu.

Par VelloDocMis à jour le Temps de lecture : 7 min

Essayez maintenant : OCR PDF

Reconnaissez les mots des pages numérisées et ajoutez une couche de texte invisible pour pouvoir rechercher et copier dans le PDF.

Ouvrir la page complète : OCR PDF

Choisir des fichiers

Déposez les fichiers ici ou cliquez pour parcourir


Formats acceptés : PDFMax. 80 MoSupprimé après livraison

Reconnaît 39 langues, deux à la fois. Vérifiez le texte reconnu avant de vous y fier.

Pourquoi l’arabe est plus difficile pour l’OCR

L’arabe s’écrit de droite à gauche dans une écriture liée : la plupart des lettres se rattachent à leurs voisines et prennent une forme différente au début, au milieu ou à la fin d’un mot, ou lorsqu’elles sont isolées. Plusieurs lettres partagent la même forme de base et ne se distinguent que par le nombre et la position de leurs points, comme ب, ت et ث : une poussière ou un point manquant peut donc changer un mot. Beaucoup de textes omettent aussi les signes des voyelles brèves, tandis que les textes religieux, poétiques et éducatifs peuvent les inclure intégralement, ajoutant de petits signes au-dessus et au-dessous de la ligne. Les nombres et les mots en caractères latins se lisent de gauche à droite au sein de phrases qui vont de droite à gauche. Un moteur d’OCR doit séparer les lettres liées, conserver chaque point et chaque signe, et tout remettre dans le bon ordre : c’est pourquoi la qualité de la numérisation compte encore plus pour l’arabe que pour l’anglais.

Comment VelloDoc reconnaît le texte arabe

OCR PDF utilise le moteur open source Tesseract avec ses données de langue arabe. Quand vous choisissez l’arabe comme langue d’OCR, chaque page est dessinée à environ 250 ppp, Tesseract y repère les mots, puis le texte reconnu est posé de façon invisible sur les mots de la page d’origine. La page garde le même aspect, mais vous pouvez désormais rechercher, sélectionner et copier son texte. Dans ce guide, l’outil ci-dessus démarre avec l’arabe déjà sélectionné. Pour un document qui mélange arabe et anglais, choisissez l’arabe et ajoutez l’anglais comme deuxième langue afin que les deux soient reconnus. Les pages qui contiennent déjà du texte sélectionnable restent telles quelles : dans un fichier mixte, seules les pages numérisées sont lues.

Numériser des documents arabes pour une meilleure reconnaissance

Partez de la page la plus nette et la plus plane possible. Sur un scanner, 300 ppp en niveaux de gris est un bon réglage par défaut pour l’arabe imprimé ; les très petits caractères ou un texte entièrement vocalisé peuvent gagner à une résolution plus élevée, tant que le résultat reste net. Même si les pages sont redessinées à environ 250 ppp pour la reconnaissance, une source propre reste importante, car le flou, le bruit et les ombres se répercutent. Au téléphone, remplissez le cadre avec la page, tenez l’appareil parallèle au papier et utilisez une lumière uniforme sans ombre sur le texte. Numériser en PDF regroupe des photos prises au téléphone dans un seul PDF, mais ne détecte pas les bords de la page et ne corrige pas la perspective : recadrez et redressez vos photos au préalable. Le guide pour des numérisations plus nettes au téléphone détaille l’éclairage et le cadrage.

Redresser les pages avant l’OCR

Les lignes inclinées perturbent la reconnaissance, et les lettres arabes liées y sont particulièrement sensibles, car le moteur suit la ligne sur laquelle elles reposent. Redresser un PDF détecte l’angle de chaque page et la redresse automatiquement. L’ordre compte : Tesseract lit les lignes horizontales de façon bien plus fiable que les lignes inclinées. Redressez d’abord, puis lancez l’OCR sur le fichier redressé. Si un document contient les versos vides d’une numérisation recto verso, retirez-les avant la reconnaissance avec Supprimer les pages blanches, ce qui fait gagner du temps et évite des pages vides dans le résultat.

Vérifier et réutiliser le texte reconnu

Ouvrez le résultat et recherchez quelques mots visibles sur la page, comme un nom ou un lieu. Si la recherche les trouve, la couche de texte fonctionne. Vérifiez ensuite les détails les plus importants, car les erreurs d’OCR sont rarement évidentes : lettres semblables qui ne diffèrent que par leurs points, lettres finales comme ة et ه ou ي et ى, dates et nombres. Les visionneuses PDF traitent différemment le texte de droite à gauche dans une couche invisible : le texte copié peut donc apparaître dans le désordre dans certaines applications, et essayer une autre visionneuse aide souvent. Pour travailler sur le texte lui-même, PDF en TXT l’enregistre dans un fichier texte brut que vous pouvez ouvrir dans tout éditeur prenant en charge l’arabe, et PDF en Word le récupère sous forme de document modifiable, sans la mise en page d’origine.

Les documents qui poseront problème à l’OCR

Certains documents dépassent tout simplement ce qu’un OCR généraliste lit de façon fiable. L’écriture manuscrite, la calligraphie décorative, les imprimés très anciens ou abîmés et les photocopies pâles produisent généralement beaucoup d’erreurs, voire aucun texte. Les tampons et signatures posés sur le texte masquent des lettres, les tableaux et les mises en page en colonnes peuvent être lus dans le mauvais ordre, et un texte entièrement vocalisé peut perdre ou déplacer ses signes. Pour ce type de documents, la couche interrogeable peut encore aider à trouver la bonne page, mais les passages importants doivent être vérifiés sur l’image ou ressaisis. Le guide sur les PDF interrogeables explique les couches de texte et quand l’OCR est le bon outil.

Questions fréquentes

VelloDoc peut-il lire l’arabe manuscrit ?

Pas de façon fiable. Les données de langue arabe sont conçues pour le texte imprimé : l’écriture manuscrite produit généralement beaucoup d’erreurs, voire aucun texte.

Pourquoi le texte arabe copié apparaît-il inversé ou morcelé ?

Les visionneuses PDF traitent différemment le texte de droite à gauche dans les couches de texte invisibles. Essayez une autre visionneuse, ou extrayez le texte avec PDF en TXT et ouvrez-le dans un éditeur qui prend en charge l’arabe.

Faut-il choisir l’arabe ou l’anglais pour un document mixte ?

Choisissez l’arabe et ajoutez l’anglais comme deuxième langue. Les deux sont alors utilisés ensemble, et les mots anglais du document sont lus de façon bien plus fiable.

L’OCR modifie-t-il l’aspect de mes pages ?

Non. Les pages gardent leur propre image, et le texte reconnu est ajouté par-dessus sous forme de couche invisible. Les pages qui contiennent déjà du texte sélectionnable restent telles quelles.

À quelle résolution faut-il numériser ?

300 ppp est un bon réglage par défaut pour l’arabe imprimé. Les très petits caractères ou un texte entièrement vocalisé peuvent gagner à une résolution plus élevée, tant que la numérisation reste nette.

Outils pour ce sujet