VelloDoc
Optimiser un PDF

Optimiser un PDF : fichiers plus légers, numérisations plus nettes, texte interrogeable

Un PDF optimisé remplit sa fonction sans accroc : il respecte la limite d’envoi, s’ouvre vite, se lit clairement, peut être fouillé et ne plante pas dans une visionneuse stricte. Quand un PDF ne répond pas à ces attentes, la cause remonte généralement à sa création, le plus souvent un scanner ou l’appareil photo d’un téléphone. Ce guide explique ce qui alourdit un PDF, pourquoi les numérisations se comportent autrement que les documents numériques et comment les outils d’optimisation s’articulent, afin que vous corrigiez la vraie cause au lieu de tâtonner avec les réglages.

Outils : Optimiser un PDF

Outils dans ce domaine : 10. Chacun renvoie à une page détaillée avec ses paramètres, ses limites et les questions fréquentes.

Compresser PDF

Réduisez la taille d’un PDF en recompressant ses images au niveau choisi, tandis que le texte et les graphiques vectoriels restent nets.

Optimiser un PDF

Compresser à une taille cible

Indiquez une taille maximale en mégaoctets et laissez une compression de plus en plus forte tenter de faire passer le PDF en dessous.

Optimiser un PDF

Réparer un PDF

Reconstruisez la structure interne d’un PDF endommagé qui affiche des erreurs ou ne s’ouvre plus, et enregistrez une copie propre.

Optimiser un PDF

OCR PDF

Reconnaissez les mots des pages numérisées et ajoutez une couche de texte invisible pour pouvoir rechercher et copier dans le PDF.

Optimiser un PDF

PDF en niveaux de gris

Convertissez chaque page en nuances de gris pour une impression noir et blanc, un envoi en niveaux de gris ou des numérisations couleur plus légères.

Optimiser un PDF

Redresser un PDF

Redressez automatiquement ou page par page les pages numérisées de travers, en conservant leur qualité et leur couche de texte.

Optimiser un PDF

Supprimer les annotations

Retire commentaires, surlignages, pense-bêtes et tampons d’un PDF sans toucher au document lui-même.

Optimiser un PDF

Supprimer les pages blanches

Détectez et supprimez les pages numérisées presque vides en mesurant la luminosité et l’encre, avec une sévérité réglable.

Optimiser un PDF

Renommer des fichiers PDF

Renommez un lot de PDF avec un nom commun, un préfixe, un suffixe et une numérotation, ou avec un texte lu sur la première page de chaque fichier.

Optimiser un PDF

Optimiser un PDF pour le web

Linéarisez un PDF pour que les navigateurs affichent la première page avant que tout le fichier soit téléchargé.

Optimiser un PDF

D’où vient la taille d’un PDF

Le texte pèse très peu dans un PDF : cent pages de texte saisi peuvent occuper moins de place qu’une seule photo. Ce qui alourdit les fichiers, ce sont les images, en particulier celles enregistrées avec plus de résolution ou de profondeur de couleur que nécessaire. Un document numérisé est le cas extrême, car chaque page est une image pleine page, même si elle ne montre que du texte noir sur papier blanc. Les polices intégrées et les dessins vectoriels nombreux ajoutent un peu de poids, mais rarement assez pour compter. La première question à se poser devant un PDF trop lourd est donc : contient-il beaucoup d’images ? Si oui, la compression et le passage en niveaux de gris aideront beaucoup ; s’il s’agit surtout de texte, ils aideront très peu, et diviser le document sera peut-être la meilleure réponse. Le guide pour réduire la taille d’un PDF détaille la résolution, la qualité JPEG et les polices.

Choisir un outil de compression

Compresser PDF propose trois niveaux. Sur un serveur équipé de Ghostscript, ils sous-échantillonnent les images à environ 72, 150 ou 300 ppp ; sans lui, seules les images dépassant le seuil de résolution de chaque niveau sont recompressées. Le texte et les graphiques vectoriels ne sont jamais transformés en images, et si le résultat n’est pas plus petit que l’original, c’est l’original qui est renvoyé. Compresser à une taille cible vise au contraire une limite stricte : il essaie des réglages de plus en plus forts, d’environ 150 ppp jusque vers 55 ppp, et s’arrête à la première tentative qui tient. Si aucune ne tient, vous recevez la plus petite version : vérifiez donc toujours la taille finale. Pour des documents en noir et blanc numérisés en couleur, PDF en niveaux de gris supprime des données inutiles, et quand une limite est tout simplement trop basse pour des pages lisibles, diviser le document est la solution honnête.

Un document numérisé est une photo de texte

Une numérisation ressemble à un document mais se comporte comme une photo : impossible d’y chercher un mot, d’en copier une phrase ou de la faire lire par un lecteur d’écran. OCR PDF change cela en reconnaissant les mots de chaque image de page et en plaçant une couche de texte invisible derrière. Les pages gardent leur propre image, et celles qui contiennent déjà du texte restent telles quelles : un fichier mixte peut donc être traité tel quel. La reconnaissance utilise un modèle de langue, si bien que choisir la langue du document compte plus que tout autre réglage. Le guide sur les PDF interrogeables explique les couches de texte, leur importance pour l’archivage et l’accessibilité, et comment savoir si un PDF en possède déjà une.

Nettoyer les numérisations avant la reconnaissance

La précision de l’OCR dépend d’une entrée propre, et deux outils la préparent. Supprimer les pages blanches repère les pages presque vides en mesurant la luminosité et la couverture d’encre, conserve toujours les pages qui contiennent déjà du texte et vous laisse choisir la sévérité de la détection. Redresser un PDF mesure l’inclinaison de chaque page et la remet d’aplomb, ce qui améliore nettement la reconnaissance, car l’OCR attend des lignes de texte droites. Le redressement tourne chaque page au lieu de la redessiner, la numérisation garde donc ses détails, et il se place avant l’OCR pour que la reconnaissance lise des lignes horizontales. Une séquence fiable pour une pile de numérisations est : supprimer les pages blanches, redresser, lancer l’OCR, puis compresser en dernier. Le guide sur la qualité des numérisations traite de la prise de vue, où la plupart des problèmes peuvent être évités.

Réparer des fichiers qui ne s’ouvrent pas

Un PDF qui affiche une erreur, des pages blanches ou un avertissement de corruption a souvent un index interne endommagé plutôt qu’un contenu manquant. Réparer un PDF ouvre le fichier avec MuPDF, qui reconstruit cet index en parcourant le fichier, et écrit une copie neuve et cohérente. Quand MuPDF ne parvient pas du tout à lire le fichier et que Ghostscript est disponible, une seconde tentative réécrit l’ensemble du document. La réparation a toutefois une limite nette : elle travaille avec les données présentes. Un téléchargement interrompu à mi-parcours n’a pas ses pages restantes, et aucun outil ne peut les reconstituer : retélécharger le fichier est généralement plus rapide que toute réparation. Les fichiers réparés constituent un bon point de départ pour l’archivage avec la conversion en PDF/A.

Préparer des PDF pour le web

Les documents publiés sur un site web ont des exigences supplémentaires. Les gros fichiers doivent s’ouvrir vite : Optimiser un PDF pour le web y contribue en linéarisant le fichier, pour que le navigateur affiche la première page avant l’arrivée du reste, à condition que le serveur web accepte les requêtes par plages d’octets, ce qui est presque toujours le cas. La taille reste importante, alors compressez d’abord. Les PDF publiés doivent aussi être lisibles par les moteurs de recherche et les lecteurs d’écran, ce qui signifie que les numérisations ont besoin d’OCR, et porter un titre pertinent plutôt qu’un nom de modèle oublié ; définissez-le avec Voir et modifier les métadonnées. Ensemble, ces étapes rendent un document plus rapide à ouvrir, plus facile à trouver et plus accessible, sans rien changer à ce qu’il dit.

Vérifier le résultat

L’optimisation implique toujours des compromis : vérifiez donc le résultat comme le ferait le destinataire. Après une compression, zoomez à 200 % sur le plus petit texte et sur les signatures. Après l’OCR, cherchez un mot visible sur une page. Après la suppression des pages blanches, contrôlez le nombre de pages et survolez le document pour repérer un manque. Conservez les originaux jusqu’à ce que le résultat vous convienne, car chaque outil produit une nouvelle copie et le fichier traité sur le serveur est supprimé dès la fin du téléchargement. Certains outils d’optimisation reposent sur des moteurs que tous les serveurs n’ont pas, comme Ghostscript ou Tesseract ; quand l’un d’eux manque, l’outil le dit clairement plutôt que de renvoyer un fichier où le travail aurait été ignoré en silence.

Enchaînements courants

Alléger une numérisation pour un portail d’envoi

Supprimez les versos vides d’une numérisation recto verso, passez les documents couleur en niveaux de gris, puis compressez à la limite de taille exacte du portail.

Rendre interrogeable une archive de numérisations

Redressez les pages inclinées, ajoutez une couche de texte interrogeable dans la bonne langue et compressez le résultat pour que l’archive reste maniable.

Sauver et publier un rapport endommagé

Reconstruisez un PDF qui ne s’ouvre pas, allégez ses images et linéarisez-le pour qu’il s’ouvre rapidement depuis votre site.

Faire passer un gros document par e-mail

Compressez d’abord le fichier et, s’il dépasse encore la limite des pièces jointes, divisez-le en parties qui tiennent chacune.

Questions sur l’optimisation des PDF

Pourquoi mon PDF est-il si lourd ?

Presque toujours à cause des images, en particulier des pages numérisées ou des photos haute résolution. Les PDF composés uniquement de texte sont légers : un gros fichier contient donc généralement beaucoup d’images.

La compression va-t-elle rendre mon texte flou ?

Le vrai texte reste net, car seules les images sont recompressées. Le texte qui fait partie d’une numérisation est une image : il s’adoucit avec les réglages les plus forts.

Faut-il lancer l’OCR avant ou après la compression ?

Lancez d’abord l’OCR, puis compressez, car la reconnaissance fonctionne mieux sur la version la plus nette de la numérisation.

Puis-je rendre une numérisation interrogeable sans changer son aspect ?

Oui. L’OCR conserve chaque page telle quelle et ajoute par-dessus les mots reconnus sous forme de texte invisible.

Pourquoi certains outils d’optimisation sont-ils indisponibles ?

La compression à une taille cible, l’OCR et l’optimisation web dépendent de Ghostscript ou Tesseract. Un serveur qui n’a pas le moteur indique lequel manque.

L’optimisation modifie-t-elle mon fichier d’origine ?

Non. Chaque outil renvoie une nouvelle copie, et la copie temporaire sur le serveur est supprimée à la fin du téléchargement.

Guides associés