Woher die Größe eines PDFs kommt
Text ist in einem PDF winzig: Hundert Seiten getippter Text können weniger Platz belegen als ein einziges Foto. Schwer werden Dateien durch Bilder, insbesondere durch Bilder mit mehr Auflösung oder Farbtiefe, als irgendjemand braucht. Ein gescanntes Dokument ist der Extremfall, denn jede Seite ist ein ganzseitiges Bild, selbst wenn sie nur schwarzen Text auf weißem Papier zeigt. Eingebettete Schriften und viele Vektorzeichnungen bringen etwas Gewicht mit, aber selten genug, um ins Gewicht zu fallen. Die erste Frage bei jedem zu großen PDF lautet also: Ist es bildlastig? Wenn ja, helfen Komprimierung und Graustufen-Umwandlung viel; besteht es vor allem aus Text, helfen sie sehr wenig, und Teilen ist womöglich die bessere Antwort. Der Ratgeber zum Verkleinern von PDFs geht ausführlich auf Auflösung, JPEG-Qualität und Schriften ein.
Das passende Komprimierungs-Tool wählen
PDF komprimieren bietet drei Stufen. Auf einem Server mit Ghostscript rechnen sie Bilder auf etwa 72, 150 oder 300 DPI herunter; ohne Ghostscript werden nur Bilder oberhalb der Auflösungsschwelle der jeweiligen Stufe neu komprimiert. Text und Vektorgrafiken werden nie in Bilder umgewandelt, und wäre das Ergebnis nicht kleiner als das Original, erhalten Sie das Original zurück. Auf Zielgröße komprimieren arbeitet dagegen auf eine feste Grenze hin: Es probiert immer stärkere Einstellungen von etwa 150 DPI bis hinunter zu etwa 55 DPI und hört beim ersten Versuch auf, der passt. Passt keiner, erhalten Sie die kleinste Version, prüfen Sie also immer die endgültige Größe. Bei Schwarz-Weiß-Unterlagen, die in Farbe gescannt wurden, entfernt PDF in Graustufen überflüssige Daten, und wenn eine Grenze schlicht zu klein für lesbare Seiten ist, ist das Dokument zu teilen die ehrliche Lösung.
Gescannte Dokumente sind Bilder von Text
Ein Scan sieht aus wie ein Dokument, verhält sich aber wie ein Foto: Man kann ihn nicht durchsuchen, keinen Satz daraus kopieren und ihn nicht von einem Screenreader vorlesen lassen. OCR PDF ändert das, indem es die Wörter in jedem Seitenbild erkennt und eine unsichtbare Textebene dahinterlegt. Die Seiten behalten ihr eigenes Bild, und Seiten, die schon Text enthalten, bleiben unverändert, eine gemischte Datei kann also im Ganzen durchlaufen. Die Erkennung nutzt ein Sprachmodell, daher ist die Wahl der Dokumentsprache wichtiger als jede andere Einstellung. Der Ratgeber zu durchsuchbaren PDFs erklärt Textebenen, warum sie für Archive und Barrierefreiheit wichtig sind und wie Sie erkennen, ob ein PDF bereits eine hat.
Scans vor der Erkennung aufbereiten
Die Genauigkeit der OCR hängt von sauberen Eingaben ab, und zwei Tools bereiten sie vor. Leere Seiten entfernen findet nahezu leere Seiten, indem es Helligkeit und Farbdeckung misst, behält Seiten mit vorhandenem Text immer bei und lässt Sie wählen, wie streng die Erkennung ist. PDF begradigen misst die Schräglage jeder Seite und richtet sie gerade aus, was die Erkennung spürbar verbessert, weil OCR gerade verlaufende Textzeilen erwartet. Das Begradigen dreht jede Seite, statt sie neu zu zeichnen, der Scan behält also seine Details, und es gehört vor die OCR, damit die Erkennung waagerechte Zeilen liest. Eine verlässliche Reihenfolge für einen Stapel Scans lautet: leere Seiten entfernen, begradigen, OCR ausführen und zuletzt komprimieren. Der Ratgeber zur Scanqualität behandelt die Aufnahme, bei der sich die meisten Probleme vermeiden lassen.
Dateien reparieren, die sich nicht öffnen lassen
Ein PDF, das eine Fehlermeldung, leere Seiten oder eine Warnung vor Beschädigung zeigt, hat oft einen defekten internen Index statt fehlender Inhalte. PDF reparieren öffnet die Datei mit MuPDF, das diesen Index durch Durchsuchen der Datei neu aufbaut, und schreibt eine frische, stimmige Kopie. Kann MuPDF die Datei gar nicht lesen und ist Ghostscript verfügbar, schreibt ein zweiter Versuch das gesamte Dokument neu. Die Reparatur hat aber eine harte Grenze: Sie arbeitet mit den vorhandenen Daten. Einem abgebrochenen Download fehlen die restlichen Seiten, und kein Tool kann sie rekonstruieren, die Datei erneut herunterzuladen, geht meist schneller als jede Reparatur. Reparierte Dateien sind ein guter Ausgangspunkt für die Archivierung mit der PDF/A-Umwandlung.
PDFs fürs Web vorbereiten
Auf einer Website veröffentlichte Dokumente haben zusätzliche Anforderungen. Große Dateien sollten schnell öffnen; dabei hilft PDF fürs Web optimieren, indem es die Datei linearisiert, sodass Browser die erste Seite anzeigen, bevor der Rest ankommt, vorausgesetzt, der Webserver unterstützt Byte-Range-Anfragen, wie fast alle. Die Größe spielt trotzdem eine Rolle, komprimieren Sie also zuerst. Veröffentlichte PDFs sollten außerdem für Suchmaschinen und Screenreader lesbar sein, Scans brauchen also OCR, und sie sollten einen sinnvollen Titel tragen statt eines übrig gebliebenen Vorlagennamens; den legen Sie mit Metadaten anzeigen und bearbeiten fest. Zusammen machen diese Schritte ein Dokument schneller zu öffnen, leichter auffindbar und barrierefreier, ohne zu ändern, was darin steht.
Das Ergebnis prüfen
Optimierung bedeutet immer Abwägungen, prüfen Sie das Ergebnis daher so, wie es der Empfänger tun würde. Zoomen Sie nach dem Komprimieren auf 200 Prozent auf den kleinsten Text und auf Unterschriften. Suchen Sie nach der OCR nach einem Wort, das Sie auf einer Seite sehen. Kontrollieren Sie nach dem Entfernen leerer Seiten die Seitenzahl und überfliegen Sie das Dokument auf Lücken. Behalten Sie die Originale, bis Sie zufrieden sind, denn jedes Tool erzeugt eine neue Kopie, und die verarbeitete Datei auf dem Server wird gelöscht, sobald Ihr Download abgeschlossen ist. Manche Optimierungs-Tools benötigen Engines, die nicht auf jedem Server installiert sind, etwa Ghostscript oder Tesseract; fehlt eine, sagt das Tool das klar, statt eine Datei zurückzugeben, bei der die Arbeit stillschweigend ausgelassen wurde.
Typische Abläufe
Einen Scan für ein Upload-Portal verkleinern
Entfernen Sie die leeren Rückseiten eines Duplex-Scans, wandeln Sie farbige Unterlagen in Graustufen um und komprimieren Sie dann genau auf die Größengrenze des Portals.
Ein Scan-Archiv durchsuchbar machen
Begradigen Sie schiefe Seiten, fügen Sie eine durchsuchbare Textebene in der richtigen Sprache hinzu und komprimieren Sie das Ergebnis, damit das Archiv handlich bleibt.
Einen defekten Bericht retten und veröffentlichen
Bauen Sie ein PDF neu auf, das sich nicht öffnen lässt, verringern Sie sein Bildgewicht und linearisieren Sie es, damit es auf Ihrer Website schnell öffnet.
Ein großes Dokument per E-Mail verschicken
Komprimieren Sie die Datei zuerst, und wenn sie dann noch über der Anhangsgrenze liegt, teilen Sie sie in Teile, die jeweils passen.
Fragen zum Optimieren von PDFs
Warum ist mein PDF so groß?
Fast immer wegen Bildern, besonders gescannter Seiten oder hochaufgelöster Fotos. Reine Text-PDFs sind klein, eine große Datei ist daher meist bildlastig.
Wird mein Text durch die Komprimierung unscharf?
Echter Text bleibt scharf, weil nur Bilder neu komprimiert werden. Text, der Teil eines Scans ist, ist ein Bild und wird bei niedrigen Einstellungen weicher.
Soll ich OCR vor oder nach dem Komprimieren ausführen?
Zuerst OCR, dann komprimieren, denn die Erkennung arbeitet am besten mit der schärfsten Fassung des Scans.
Kann ich einen Scan durchsuchbar machen, ohne sein Aussehen zu ändern?
Ja. OCR behält jede Seite genau bei und legt die erkannten Wörter als unsichtbaren Text darüber.
Warum sind manche Optimierungs-Tools nicht verfügbar?
Komprimieren auf Zielgröße, OCR und Web-Optimierung benötigen Ghostscript oder Tesseract. Ein Server ohne die Engine meldet, welche fehlt.
Verändert die Optimierung meine Originaldatei?
Nein. Jedes Tool gibt eine neue Kopie zurück, und die temporäre Kopie auf dem Server wird nach Abschluss Ihres Downloads gelöscht.