Couches de texte et images de texte
Un PDF créé depuis un traitement de texte, un tableur ou un navigateur stocke le texte sous forme de caractères : chaque lettre est enregistrée avec sa police, sa taille et sa position sur la page. Comme le fichier sait quels caractères il contient, les visionneuses peuvent les rechercher, les sélectionner, les copier et les transmettre aux technologies d’assistance. Un scanner ou l’appareil photo d’un téléphone fonctionne autrement. Il enregistre une image de la page, une grille de pixels colorés qui ignore que certains de ces pixels forment le mot « facture ». Le résultat peut paraître parfaitement net sans contenir le moindre texte. Beaucoup de documents réels mélangent les deux types de pages : un contrat produit numériquement avec une page de signatures numérisée ajoutée à la fin, ou un rapport avec des annexes photographiées. C’est pourquoi la recherche trouve parfois un mot en page 3 mais pas en page 12, alors que vous pouvez le lire sans peine sur les deux.
Vérifier un PDF en dix secondes
Le test le plus rapide consiste à essayer de sélectionner un mot. Si les mots se surlignent quand vous faites glisser le curseur, la page a une couche de texte. Si le curseur trace plutôt un rectangle sur la page, vous regardez une image. Un deuxième test consiste à chercher un mot que vous voyez : aucun résultat pour un mot visible signifie que cette page n’a pas de texte exploitable. Zoomer fournit un troisième indice utile : le vrai texte reste net à tous les grossissements, tandis que le texte d’une image devient flou et pixelisé. Pour les documents mixtes, vérifiez plusieurs pages plutôt que la première seulement. Pour voir exactement quel texte contient un PDF, PDF en TXT l’extrait ; un fichier qui revient vide, ou vide pour certaines pages, vous indique où manque la couche de texte.
Ce que fait réellement l’OCR
La reconnaissance optique de caractères retransforme des images de texte en caractères. Le logiciel repère les lignes de texte d’une page, les découpe en mots et en lettres, et compare les formes qu’il voit à un modèle entraîné d’une langue, en choisissant les caractères et les mots les plus probables. Le résultat n’est pas un simple flux de texte, mais un texte avec des positions, si bien que chaque mot reconnu peut être placé exactement sur son image. OCR PDF utilise le moteur Tesseract. Chaque page est dessinée à environ 250 ppp et reconnue, puis le texte reconnu est posé de façon invisible sur la page d’origine, qui garde sa propre image. On parle souvent de PDF « sandwich ». Quand vous lancez une recherche, la visionneuse trouve le mot caché et surligne l’endroit où apparaît le mot visible : la page semble inchangée tout en se comportant comme un document numérique.
Pourquoi le choix de la langue compte
Les moteurs d’OCR ne reconnaissent pas les lettres isolément. Ils s’appuient sur des modèles de langue qui savent quels caractères existent, comment ils se combinent et quels mots sont probables. Choisir la bonne langue améliore considérablement la précision : un modèle anglais qui lit une lettre en français malmène les caractères accentués et lit mal les mots qu’il n’attend pas, et un modèle d’écriture latine ne peut pas lire du tout l’arabe ou l’ourdou, car ces écritures utilisent d’autres caractères et s’écrivent de droite à gauche. VelloDoc propose 39 langues, dont l’arabe, l’hébreu, l’hindi, le chinois, le japonais et le coréen, et chaque langue nécessite ses données installées sur le serveur. Pour les documents qui mélangent plusieurs langues, choisissez la principale et ajoutez l’autre comme deuxième langue. Si une langue n’est pas installée, l’outil le signale au lieu de renvoyer un PDF sans couche de texte exploitable.
Obtenir des résultats précis à partir de numérisations
La plupart des erreurs d’OCR se jouent au moment de la capture de la page, pas au moment de la reconnaissance. La résolution compte : en règle générale, numériser un texte imprimé ordinaire à environ 300 ppp donne assez de détails à la reconnaissance, et les très petits caractères gagnent à une résolution plus élevée. Le contraste compte aussi : un texte foncé sur un papier blanc et propre se reconnaît bien mieux qu’un texte pâle sur fond gris ou à motifs. Des lignes droites comptent, car la reconnaissance attend des lignes de texte horizontales ; Redresser un PDF corrige les petites inclinaisons avant la reconnaissance. Les pages blanches n’ajoutent que du temps de traitement, et Supprimer les pages blanches les élimine. Les ombres, les pages bombées près de la reliure d’un livre et les reflets du papier glacé sont les problèmes les plus fréquents des numérisations au téléphone ; le guide pour des numérisations plus nettes au téléphone explique comment les éviter.
Vérifier et corriger le texte reconnu
Même un bon OCR fait des erreurs, et ces erreurs suivent des schémas. Les caractères qui se ressemblent sont confondus : les lettres r et n côte à côte peuvent devenir m, le chiffre 0 et la lettre O s’échangent, et 1, l et I se mélangent facilement. Le texte des tableaux peut sortir dans un ordre inattendu, et les pages en plusieurs colonnes peuvent être lues en travers plutôt que colonne par colonne. Les noms, références, dates et montants méritent la plus grande attention, car un seul chiffre erroné change leur sens tout en restant plausible. Une vérification pratique consiste à rechercher dans le résultat de l’OCR plusieurs mots et nombres visibles sur la page. Pour les documents où la formulation exacte compte, comme les pièces juridiques ou financières, considérez le texte reconnu comme une aide à la recherche et fiez-vous toujours à l’image de la page comme version de référence.
Interrogeable ne veut pas dire accessible
Une couche de texte est un grand pas pour l’accessibilité, car les lecteurs d’écran peuvent enfin lire à voix haute les mots d’une page numérisée. Un PDF pleinement accessible exige toutefois davantage. Les documents accessibles comportent des balises qui décrivent la structure, par exemple quel texte est un titre, lequel est une liste et quelle image nécessite une description, et ils définissent un ordre de lecture pour que les technologies d’assistance présentent le contenu dans une séquence logique. L’OCR n’ajoute pas ces balises. La norme PDF/UA décrit les exigences d’une accessibilité complète. Quand vous avez besoin d’un contenu facile à lire pour tous, y compris sur téléphone, convertir le PDF interrogeable en page web avec PDF en HTML est une autre voie pratique, car le texte HTML s’adapte à l’écran et fonctionne naturellement avec les fonctions d’accessibilité des navigateurs.
Quand l’OCR n’est pas le bon outil
L’OCR s’adresse aux pages qui sont des images. VelloDoc laisse telles quelles les pages qui contiennent déjà du texte : le lancer sur un PDF numérique vous le rend donc simplement inchangé. Il existe une exception importante : certains PDF numériques contiennent un texte d’apparence normale qui se copie sous forme de charabia, parce que le fichier stocke les caractères sans indiquer quelles lettres ils représentent. L’OCR corrige cela en lisant la page visible. Si vous disposez du document d’origine, exporter un nouveau PDF à partir de celui-ci vaut toujours mieux que reconnaître une numérisation. Pour un archivage durable, un ordre logique consiste à numériser, nettoyer, lancer l’OCR, puis convertir le résultat avec PDF en PDF/A pour que le document interrogeable reste lisible pendant des années. Le guide des outils d’optimisation montre comment ces étapes s’enchaînent. Pour les documents en écriture arabe, consultez les guides sur l’OCR des PDF en arabe et l’OCR des PDF en ourdou.
Questions fréquentes
Pourquoi je vois le texte mais ne peux pas le rechercher ?
La page est une image du texte plutôt que le texte lui-même, ce qui est typique des numérisations et des photos prises au téléphone. Lancez OCR PDF pour ajouter une couche de texte interrogeable.
L’OCR modifie-t-il l’aspect de mon PDF ?
Non. VelloDoc conserve chaque page telle quelle et pose par-dessus les mots reconnus sous forme de texte invisible.
L’OCR peut-il lire l’écriture manuscrite ?
En général, pas de façon fiable. Tesseract est conçu pour le texte imprimé ; des capitales d’imprimerie bien formées sont parfois reconnues, mais l’écriture cursive ne l’est généralement pas.
Le texte issu de l’OCR est-il assez précis pour des documents juridiques ?
Utilisez-le pour retrouver et parcourir les documents, mais vérifiez les noms, chiffres et dates sur l’image de la page. L’image reste la référence.
Faut-il lancer l’OCR sur un PDF déjà interrogeable ?
Non, sauf si son texte se copie sous forme de caractères incohérents. L’OCR sur un PDF numérique remplace le vrai texte par une image et une couche de texte cachée.