D’où vient la taille d’un PDF
Le texte pèse très peu dans un PDF : cent pages de texte saisi peuvent occuper moins de place qu’une seule photo. Ce qui alourdit les fichiers, ce sont les images, en particulier celles enregistrées avec plus de résolution ou de profondeur de couleur que nécessaire. Un document numérisé est le cas extrême, car chaque page est une image pleine page, même si elle ne montre que du texte noir sur papier blanc. Les polices intégrées et les dessins vectoriels nombreux ajoutent un peu de poids, mais rarement assez pour compter. La première question à se poser devant un PDF trop lourd est donc : contient-il beaucoup d’images ? Si oui, la compression et le passage en niveaux de gris aideront beaucoup ; s’il s’agit surtout de texte, ils aideront très peu, et diviser le document sera peut-être la meilleure réponse. Le guide pour réduire la taille d’un PDF détaille la résolution, la qualité JPEG et les polices.
Choisir un outil de compression
Compresser PDF propose trois niveaux. Sur un serveur équipé de Ghostscript, ils sous-échantillonnent les images à environ 72, 150 ou 300 ppp ; sans lui, seules les images dépassant le seuil de résolution de chaque niveau sont recompressées. Le texte et les graphiques vectoriels ne sont jamais transformés en images, et si le résultat n’est pas plus petit que l’original, c’est l’original qui est renvoyé. Compresser à une taille cible vise au contraire une limite stricte : il essaie des réglages de plus en plus forts, d’environ 150 ppp jusque vers 55 ppp, et s’arrête à la première tentative qui tient. Si aucune ne tient, vous recevez la plus petite version : vérifiez donc toujours la taille finale. Pour des documents en noir et blanc numérisés en couleur, PDF en niveaux de gris supprime des données inutiles, et quand une limite est tout simplement trop basse pour des pages lisibles, diviser le document est la solution honnête.
Un document numérisé est une photo de texte
Une numérisation ressemble à un document mais se comporte comme une photo : impossible d’y chercher un mot, d’en copier une phrase ou de la faire lire par un lecteur d’écran. OCR PDF change cela en reconnaissant les mots de chaque image de page et en plaçant une couche de texte invisible derrière. Les pages gardent leur propre image, et celles qui contiennent déjà du texte restent telles quelles : un fichier mixte peut donc être traité tel quel. La reconnaissance utilise un modèle de langue, si bien que choisir la langue du document compte plus que tout autre réglage. Le guide sur les PDF interrogeables explique les couches de texte, leur importance pour l’archivage et l’accessibilité, et comment savoir si un PDF en possède déjà une.
Nettoyer les numérisations avant la reconnaissance
La précision de l’OCR dépend d’une entrée propre, et deux outils la préparent. Supprimer les pages blanches repère les pages presque vides en mesurant la luminosité et la couverture d’encre, conserve toujours les pages qui contiennent déjà du texte et vous laisse choisir la sévérité de la détection. Redresser un PDF mesure l’inclinaison de chaque page et la remet d’aplomb, ce qui améliore nettement la reconnaissance, car l’OCR attend des lignes de texte droites. Le redressement tourne chaque page au lieu de la redessiner, la numérisation garde donc ses détails, et il se place avant l’OCR pour que la reconnaissance lise des lignes horizontales. Une séquence fiable pour une pile de numérisations est : supprimer les pages blanches, redresser, lancer l’OCR, puis compresser en dernier. Le guide sur la qualité des numérisations traite de la prise de vue, où la plupart des problèmes peuvent être évités.
Réparer des fichiers qui ne s’ouvrent pas
Un PDF qui affiche une erreur, des pages blanches ou un avertissement de corruption a souvent un index interne endommagé plutôt qu’un contenu manquant. Réparer un PDF ouvre le fichier avec MuPDF, qui reconstruit cet index en parcourant le fichier, et écrit une copie neuve et cohérente. Quand MuPDF ne parvient pas du tout à lire le fichier et que Ghostscript est disponible, une seconde tentative réécrit l’ensemble du document. La réparation a toutefois une limite nette : elle travaille avec les données présentes. Un téléchargement interrompu à mi-parcours n’a pas ses pages restantes, et aucun outil ne peut les reconstituer : retélécharger le fichier est généralement plus rapide que toute réparation. Les fichiers réparés constituent un bon point de départ pour l’archivage avec la conversion en PDF/A.
Préparer des PDF pour le web
Les documents publiés sur un site web ont des exigences supplémentaires. Les gros fichiers doivent s’ouvrir vite : Optimiser un PDF pour le web y contribue en linéarisant le fichier, pour que le navigateur affiche la première page avant l’arrivée du reste, à condition que le serveur web accepte les requêtes par plages d’octets, ce qui est presque toujours le cas. La taille reste importante, alors compressez d’abord. Les PDF publiés doivent aussi être lisibles par les moteurs de recherche et les lecteurs d’écran, ce qui signifie que les numérisations ont besoin d’OCR, et porter un titre pertinent plutôt qu’un nom de modèle oublié ; définissez-le avec Voir et modifier les métadonnées. Ensemble, ces étapes rendent un document plus rapide à ouvrir, plus facile à trouver et plus accessible, sans rien changer à ce qu’il dit.
Vérifier le résultat
L’optimisation implique toujours des compromis : vérifiez donc le résultat comme le ferait le destinataire. Après une compression, zoomez à 200 % sur le plus petit texte et sur les signatures. Après l’OCR, cherchez un mot visible sur une page. Après la suppression des pages blanches, contrôlez le nombre de pages et survolez le document pour repérer un manque. Conservez les originaux jusqu’à ce que le résultat vous convienne, car chaque outil produit une nouvelle copie et le fichier traité sur le serveur est supprimé dès la fin du téléchargement. Certains outils d’optimisation reposent sur des moteurs que tous les serveurs n’ont pas, comme Ghostscript ou Tesseract ; quand l’un d’eux manque, l’outil le dit clairement plutôt que de renvoyer un fichier où le travail aurait été ignoré en silence.
Enchaînements courants
Alléger une numérisation pour un portail d’envoi
Supprimez les versos vides d’une numérisation recto verso, passez les documents couleur en niveaux de gris, puis compressez à la limite de taille exacte du portail.
Rendre interrogeable une archive de numérisations
Redressez les pages inclinées, ajoutez une couche de texte interrogeable dans la bonne langue et compressez le résultat pour que l’archive reste maniable.
Sauver et publier un rapport endommagé
Reconstruisez un PDF qui ne s’ouvre pas, allégez ses images et linéarisez-le pour qu’il s’ouvre rapidement depuis votre site.
Faire passer un gros document par e-mail
Compressez d’abord le fichier et, s’il dépasse encore la limite des pièces jointes, divisez-le en parties qui tiennent chacune.
Questions sur l’optimisation des PDF
Pourquoi mon PDF est-il si lourd ?
Presque toujours à cause des images, en particulier des pages numérisées ou des photos haute résolution. Les PDF composés uniquement de texte sont légers : un gros fichier contient donc généralement beaucoup d’images.
La compression va-t-elle rendre mon texte flou ?
Le vrai texte reste net, car seules les images sont recompressées. Le texte qui fait partie d’une numérisation est une image : il s’adoucit avec les réglages les plus forts.
Faut-il lancer l’OCR avant ou après la compression ?
Lancez d’abord l’OCR, puis compressez, car la reconnaissance fonctionne mieux sur la version la plus nette de la numérisation.
Puis-je rendre une numérisation interrogeable sans changer son aspect ?
Oui. L’OCR conserve chaque page telle quelle et ajoute par-dessus les mots reconnus sous forme de texte invisible.
Pourquoi certains outils d’optimisation sont-ils indisponibles ?
La compression à une taille cible, l’OCR et l’optimisation web dépendent de Ghostscript ou Tesseract. Un serveur qui n’a pas le moteur indique lequel manque.
L’optimisation modifie-t-elle mon fichier d’origine ?
Non. Chaque outil renvoie une nouvelle copie, et la copie temporaire sur le serveur est supprimée à la fin du téléchargement.