VelloDoc
Optimiser un PDF

OCR PDF

Ajoutez une couche de texte interrogeable et sélectionnable à vos PDF numérisés grâce à l’OCR, en 39 langues. Les pages gardent leur aspect, et le texte peut aussi être exporté.

Choisir des fichiers

Déposez les fichiers ici ou cliquez pour parcourir


Formats acceptés : PDFMax. 80 MoSupprimé après livraison

Reconnaît 39 langues, deux à la fois. Vérifiez le texte reconnu avant de vous y fier.

Outils associés

Les étapes suivantes les plus courantes après celui-ci.

Un PDF numérisé ressemble à un document mais se comporte comme une photo : impossible d’y chercher un mot, d’en copier une phrase ou de le faire lire par un lecteur d’écran. La reconnaissance optique de caractères règle ce problème. OCR PDF lit les mots de chaque page et les pose par-dessus sous forme de texte invisible : la page reste identique mais devient interrogeable, sélectionnable et indexable. L’outil lit 39 langues, deux à la fois pour les documents qui les mélangent, et peut aussi vous rendre le texte dans un fichier à part.

Comment utiliser OCR PDF

  1. Ajoutez le PDF numérisé. Redressez d’abord les pages de travers avec Redresser un PDF pour plus de précision.
  2. Choisissez la langue du document, et une deuxième langue si les pages en mélangent deux.
  3. Choisissez PDF interrogeable ou fichier texte, puis sélectionnez Lancer l’OCR.
  4. Téléchargez le résultat et testez-le en cherchant un mot visible sur une page.

Comment la couche interrogeable est créée

Chaque page est dessinée à 250 ppp et le moteur Tesseract y repère les mots. Ces mots sont ensuite posés sur la page d’origine sous forme de texte invisible, aux mêmes positions que les mots que vous voyez. La numérisation garde sa propre résolution, et le vrai texte, les dessins ou les liens de la page restent tels quels : seule la couche invisible est ajoutée. Les pages qui contiennent déjà du texte, saisi ou issu d’un OCR précédent, ne sont pas touchées, si bien qu’un deuxième passage ne double pas le texte.

Choisir la bonne langue

L’OCR reconnaît les caractères avec le modèle d’une langue donnée : choisir la langue du document compte plus que tout autre réglage. La liste comprend 39 langues, dont l’arabe, le chinois simplifié et traditionnel, le grec, l’hébreu, l’hindi, le japonais, le coréen, le russe, le thaï, le turc, l’ukrainien, l’ourdou et le vietnamien, en plus des principales langues européennes. Pour un document qui mélange des langues, comme un contrat en français avec une annexe en anglais, choisissez une deuxième langue : les deux modèles sont utilisés ensemble. Avec le mauvais modèle, une lettre française lue comme de l’anglais perd ses accents et ses mots sont mal lus. Pour les numérisations en écriture arabe, les guides de l’OCR de l’arabe et de l’OCR de l’ourdou expliquent la préparation et la précision à attendre.

Obtenir des résultats précis

La reconnaissance vaut ce que vaut la numérisation. Les pages droites, bien éclairées et contrastées donnent les meilleurs résultats, et Redresser un PDF aide quand elles sont inclinées. Les petits caractères, l’écriture manuscrite, les tampons sur le texte et les mises en page en colonnes concentrent les erreurs : vérifiez noms, nombres et dates. Choisissez Fichier texte pour récupérer les mots reconnus dans un .txt, page après page, ou poursuivez avec PDF en Word pour un document modifiable. Le guide sur les PDF interrogeables explique les couches de texte en détail.

Quand utiliser OCR PDF

Archives de documents interrogeables

Retrouvez par mot-clé des années de courriers et de relevés numérisés au lieu d’ouvrir les fichiers un à un.

Copier le texte d’une numérisation

Sélectionnez et copiez un paragraphe, une adresse ou une référence sur une page numérisée au lieu de le retaper.

Lisible par les lecteurs d’écran

Une couche de texte permet aux lecteurs d’écran de lire à voix haute les pages numérisées, premier pas vers un document accessible.

Limites à connaître

OCR PDF reconnaît le texte imprimé dans 39 langues, jusqu’à deux par tâche, et nécessite Tesseract avec les données de la langue sur le serveur. Les pages qui contiennent déjà du texte restent telles quelles. Attendez-vous à des erreurs sur les petits caractères, l’écriture manuscrite et les mises en page complexes, et vérifiez noms, nombres et dates.

OCR PDF : questions fréquentes

Comment savoir si mon PDF a besoin de l’OCR ?

Essayez de sélectionner un mot avec le curseur ou cherchez un mot visible. Si rien n’est trouvé, ou si vous ne pouvez que tracer un cadre sur la page, le texte fait partie d’une image et l’OCR vous aidera.

L’OCR change-t-il l’aspect du document ?

Non. Chaque page est conservée telle quelle, qualité d’image comprise, et les mots reconnus sont ajoutés par-dessus sous forme de texte invisible.

L’OCR peut-il lire l’écriture manuscrite ?

Tesseract est conçu pour le texte imprimé. Des capitales d’imprimerie soignées sont parfois reconnues, mais l’écriture cursive ne l’est généralement pas : ne vous fiez pas à l’OCR pour des notes manuscrites.

Puis-je obtenir seulement le texte ?

Oui. Choisissez Fichier texte comme résultat : les mots reconnus arrivent dans un fichier .txt, page par page. Les pages qui avaient déjà du texte fournissent ce texte tel quel.

Pourquoi l’OCR indique-t-il qu’une langue n’est pas installée ?

Chaque langue a besoin de ses données Tesseract sur le serveur. Si elles manquent, VelloDoc le signale au lieu de renvoyer un fichier sans couche de texte.

En savoir plus