Herausfinden, was die Datei groß macht
Bevor Sie irgendeine Einstellung ändern, klären Sie, welche Art von PDF Sie vor sich haben. Text selbst ist erstaunlich kompakt: Eine Seite getippter Wörter, als Zeichen gespeichert, belegt oft nur wenige Kilobyte. Die Megabyte stecken in Bildern. Ein gescanntes Dokument ist der Extremfall, denn jede Seite ist ein ganzseitiges Foto des Papiers, selbst wenn darauf nur schwarzer Text steht. Handyfotos bringen jeweils mehrere Megabyte mit, und eine mit hochaufgelösten Bildern exportierte Präsentation kann größer sein als die ursprüngliche Präsentationsdatei. Ein schneller Test zeigt, welcher Fall vorliegt: Versuchen Sie, ein Wort zu markieren. Zieht der Cursor einen Rahmen auf, statt Text hervorzuheben, ist die Seite ein Bild, und Bildkomprimierung bringt echten Nutzen. Lässt sich der Text normal markieren und ist die Datei trotzdem groß, suchen Sie nach eingebetteten Fotos, Screenshots und Diagrammen. Die Dateigröße durch die Seitenzahl zu teilen, liefert einen weiteren Hinweis: Eine 40-MB-Datei mit 20 Seiten hat im Schnitt 2 MB pro Seite, fast immer ein Zeichen für gescannte oder fotografische Seiten.
Die Auflösung ist die wichtigste Einstellung
Die Bildauflösung wird in DPI gemessen, der Zahl der Pixel pro Zoll der gedruckten Seite. Sie wirkt sich überproportional auf die Größe aus, weil Pixel mit der Fläche wachsen, nicht mit der Breite. Eine mit 300 DPI gescannte A4-Seite misst etwa 2.480 mal 3.508 Pixel, rund 8,7 Millionen Pixel. Dieselbe Seite mit 150 DPI misst etwa 1.240 mal 1.754 Pixel, rund 2,2 Millionen, ein Viertel der Daten. Die Auflösung zu halbieren, entfernt also etwa drei Viertel der Pixel, noch bevor überhaupt komprimiert wird. Zum Lesen am Bildschirm sind 150 DPI für normalen Text angenehm; Kleingedrucktes, Fußnoten und Unterschriften bleiben um 200 DPI klarer, und 300 DPI sind ein übliches Ziel für den Druck. Gute Komprimierungs-Tools verkleinern nur Bilder oberhalb des Ziels, eine Seite mit bereits 120 DPI wird durch eine 150-DPI-Einstellung also nicht schlechter. PDF komprimieren arbeitet so, mit Stufen für Bildschirm, Alltag und Druck.
Warum JPEG-Komprimierung zuerst den Text verwischt
Die meisten fotografischen Bilder in PDFs nutzen JPEG-Komprimierung, die Platz spart, indem sie Details verwirft, die dem Auge kaum fehlen. Sie teilt ein Bild in kleine Blöcke und vereinfacht jeden davon. Fotos vertragen das gut, denn sie bestehen aus weichen Verläufen. Text nicht, denn Buchstaben sind harte schwarze Kanten auf Weiß, und aggressive JPEG-Einstellungen hinterlassen um jedes Zeichen schwache Säume, verschmierte Serifen und blockartiges Rauschen. Deshalb verschlechtert sich ein gescannter Vertrag bei gleicher Qualitätseinstellung viel schneller als ein Urlaubsfoto. Zwei Gewohnheiten helfen. Erstens: Komprimieren Sie vom Original aus und nicht von einer bereits komprimierten Kopie, denn jede verlustbehaftete Runde legt neue Artefakte über die alten. Zweitens: Beurteilen Sie die Qualität am kleinsten Text im Dokument, nicht am Gesamteindruck der Seite. Strichzeichnungen und Screenshots sind mit verlustfreier Komprimierung besser bedient, die Kanten exakt erhält, bei Fotos aber größere Dateien erzeugt.
Farbe, Graustufen und Schwarz-Weiß
Ein Farbbild speichert für jedes Pixel drei Informationskanäle, ein Graustufenbild nur einen. Als Faustregel senkt die Umwandlung in Graustufen die Rohdaten eines Bildes vor der Komprimierung auf etwa ein Drittel, und Scans gewöhnlicher Unterlagen verlieren dabei nichts Wesentliches. Graustufen erhalten den vollen Tonwertumfang, Schattierungen, Fotos und Stempel wirken also weiterhin natürlich. Die falsche Wahl sind sie, wenn Farbe Information trägt: Diagramme mit farbcodierten Datenreihen, hervorgehobene Passagen, farbige Anmerkungen oder Unterschriften, bei denen die blaue Tinte Teil des Originalnachweises ist. PDF in Graustufen wandelt das gesamte Dokument um; auf einem Server mit Ghostscript bleibt Text echter Text, während die Ausweichlösung Seiten als Graustufenbilder rendert. Für gescannte Briefe, Formulare und Auszüge sind Graustufen mit anschließender moderater Komprimierung oft die wirksamste Kombination, um eine kleine Größe zu erreichen und alles lesbar zu halten.
Schriften, Dopplungen und verborgener Ballast
Nach den Bildern stammt das übrige Gewicht eines PDFs meist aus eingebetteten Schriften und aus der Art, wie die Datei gespeichert wurde. Gut erstellte PDFs betten nur die tatsächlich verwendeten Zeichen ein, eine sogenannte Teilmenge, manche Dokumente betten jedoch vollständige Schriften ein, und eine Datei mit vielen Schriften kann erstaunlich viele Schriftdaten mitschleppen. Logos und Hintergründe, die sich auf jeder Seite wiederholen, werden je nach erstellender Software einmal gespeichert und wiederverwendet oder auf jeder Seite erneut abgelegt. Dokumente, die oft bearbeitet und gespeichert wurden, können außerdem ungenutzte Objekte aus früheren Fassungen ansammeln. Die Datei beim Neuschreiben zu bereinigen, was VelloDoc bei jedem Speichern eines PDFs tut, entfernt diesen Ballast. Diese Gewinne sind real, aber bescheiden im Vergleich zur Bildkomprimierung; allein retten sie eine Datei, die ein Mehrfaches über einer Grenze liegt, daher selten.
Eine harte Größengrenze einhalten
Upload-Portale interessiert eine einzige Zahl, und selbst die ist mehrdeutig: Manche zählen ein Megabyte als 1.048.576 Byte, andere als 1.000.000. Zielen Sie etwas unter die angegebene Grenze, etwa 1,9 MB bei einem 2-MB-Formular, um eine Ablehnung zu vermeiden. Auf Zielgröße komprimieren ist genau dafür gebaut. Es unternimmt eine Reihe von Versuchen mit jeweils geringerer Bildauflösung und JPEG-Qualität, beginnend bei etwa 150 DPI und abwärts bis etwa 55 DPI, und behält das erste Ergebnis, das passt, weil dieses die meisten Details bewahrt. Passt kein Versuch, liefert es statt einer Fehlermeldung die kleinste Version, prüfen Sie also immer die endgültige Größe. Öffnen Sie die Datei dann und lesen Sie den kleinsten Text auf der Seite. Eine Datei, die die Grenze einhält, aber nicht lesbar ist, hat das Problem nicht gelöst, sondern nur an die Person weitergereicht, die Ihren Antrag prüft.
Wenn Komprimieren die falsche Antwort ist
Manche Dateien erreichen eine Grenze nicht, ohne unleserlich zu werden, und manche sollten gar nicht komprimiert werden. Muss ein 60-seitiges Scanpaket in 2 MB passen, heißt die ehrliche Antwort oft, weniger zu schicken: Entfernen Sie Seiten, die der Empfänger nicht braucht, mit Seiten entfernen, streichen Sie leere Scanseiten mit Leere Seiten entfernen oder teilen Sie das Dokument mit PDF teilen in einzeln hochzuladende Teile. Bei Dokumenten, die Sie archivieren, behalten Sie das Original in voller Qualität und komprimieren nur die Kopie, die Sie versenden. Und bei PDFs auf einer Website gilt: Eine Datei schneller öffnen zu lassen, ist eine andere Aufgabe, als sie zu verkleinern, PDF fürs Web optimieren ordnet die Datei für das schrittweise Laden neu, verringert aber nicht ihre Größe; beides wird am besten kombiniert.
Eine praktische Checkliste
Gehen Sie vom Original aus, nicht von einer bereits komprimierten Kopie. Entfernen Sie Seiten, die nicht verschickt werden müssen, auch die leeren Rückseiten von Duplex-Scans. Handelt es sich um Schwarz-Weiß-Unterlagen, wandeln Sie in Graustufen um. Komprimieren Sie mit der ausgewogenen Stufe und vergleichen Sie das Ergebnis bei 200 Prozent Zoom mit dem Original, mit Blick auf den kleinsten Text und die Unterschriften. Schreibt ein Portal eine Grenze vor, nutzen Sie die Komprimierung auf Zielgröße mit einem Wert knapp darunter und prüfen Sie die Lesbarkeit erneut. Lässt sich das Ziel auch dann nicht ohne Einbußen bei der Lesbarkeit erreichen, teilen Sie das Dokument oder fragen Sie den Empfänger nach einem anderen Übermittlungsweg. Behalten Sie das Original, bis die kleinere Fassung angenommen wurde. Diese Reihenfolge vermeidet die zwei häufigsten Fehlschläge: Dateien, die klein, aber unleserlich sind, und Stunden im Kampf gegen eine Grenze, die keine vernünftige Komprimierung erreichen kann. Der Leitfaden zu den Optimierungs-Tools behandelt die zugehörigen Tools ausführlicher, und der Ratgeber zur Scanqualität zeigt, wie Sie von vornherein kleinere, sauberere Scans erstellen.
Fragen
Warum ist mein gescanntes PDF so viel größer als ein getipptes Dokument?
Jede gescannte Seite ist ein ganzseitiges Bild, während ein getipptes Dokument seine Wörter als kompakte Zeichen speichert. Eine Textseite belegt als Zeichen vielleicht wenige Kilobyte, als Bild Hunderte Kilobyte.
Welche Auflösung eignet sich für ein PDF, das ich per E-Mail verschicke?
Etwa 150 DPI passen für die meisten Dokumente, die am Bildschirm gelesen werden. Wählen Sie etwa 200 DPI, wenn das Dokument Kleingedrucktes oder Unterschriften enthält, die lesbar bleiben müssen, und behalten Sie 300 DPI für den Druck.
Wird ein PDF kleiner, wenn ich es zweimal komprimiere?
Meist nur geringfügig, und jede verlustbehaftete Runde fügt Artefakte hinzu. Komprimieren Sie das Original einmal mit der benötigten Stufe, statt eine komprimierte Kopie erneut zu komprimieren.
Entfernt die Komprimierung Seiten oder Text?
Nein. Die Komprimierung ändert, wie Bilder gespeichert werden. Seiten, Text und Dokumentstruktur bleiben unverändert, auch wenn gescannter Text bei starken Einstellungen weicher wirken kann.
Warum hat die Komprimierung meine Datei kaum verändert?
Die Datei besteht wahrscheinlich überwiegend aus Text oder ist bereits komprimiert. VelloDoc gibt Ihr Original zurück, wenn das Ergebnis nicht kleiner wäre. Teilen oder Seiten entfernen ist dann womöglich der bessere Weg.