VelloDoc
Scannen und OCR

Was macht ein PDF durchsuchbar?

Zwei PDFs können am Bildschirm identisch aussehen und sich völlig unterschiedlich verhalten. In dem einen können Sie nach einem Namen suchen, einen Absatz kopieren und die Seite von einem Screenreader vorlesen lassen; in dem anderen passiert nichts, weil die Seite nur ein Bild von Text ist. Der Unterschied ist eine Textebene. Dieser Ratgeber erklärt, was eine Textebene ist, wie Sie prüfen, ob ein PDF eine hat, wie optische Zeichenerkennung aus einem Scan eine erstellt und wovon es abhängt, ob der erkannte Text zuverlässig genug ist.

Von VelloDocAktualisiert am Lesezeit: 7 Min.

Jetzt ausprobieren: OCR PDF

Wörter auf gescannten Seiten erkennen und eine unsichtbare Textebene hinzufügen, damit die PDF-Datei durchsucht und kopiert werden kann.

Vollständige Seite öffnen: OCR PDF

Dateien auswählen

Dateien hier ablegen oder zum Durchsuchen klicken


Akzeptiert: PDFMax. 80 MBNach Auslieferung gelöscht

Erkennt 39 Sprachen, zwei gleichzeitig. Prüfen Sie den erkannten Text, bevor Sie sich darauf verlassen.

Textebenen und Bilder von Text

Ein PDF, das aus einer Textverarbeitung, einer Tabellenkalkulation oder einem Webbrowser erstellt wurde, speichert Text als Zeichen: Jeder Buchstabe wird mit Schrift, Größe und Position auf der Seite erfasst. Weil die Datei weiß, welche Zeichen vorhanden sind, können Viewer sie durchsuchen, markieren, kopieren und an Hilfstechnologien weitergeben. Ein Scanner oder eine Handykamera arbeitet anders. Er erfasst ein Bild der Seite, ein Raster aus farbigen Pixeln, das nicht weiß, dass einige dieser Pixel das Wort „Rechnung“ bilden. Das Ergebnis kann vollkommen scharf aussehen und dennoch keinerlei Text enthalten. Viele echte Dokumente mischen beide Seitenarten: ein digital erstellter Vertrag mit angehängter gescannter Unterschriftenseite oder ein Bericht mit fotografierten Anhängen. Deshalb findet die Suche ein Wort manchmal auf Seite 3, aber nicht auf Seite 12, obwohl Sie es auf beiden deutlich lesen können.

Ein PDF in zehn Sekunden prüfen

Der schnellste Test: Versuchen Sie, ein Wort zu markieren. Werden die Wörter beim Ziehen hervorgehoben, hat die Seite eine Textebene. Zieht der Cursor stattdessen ein Rechteck über die Seite, sehen Sie ein Bild. Ein zweiter Test ist, nach einem sichtbaren Wort zu suchen; kein Treffer für ein sichtbares Wort bedeutet, dass die Seite keinen verwertbaren Text hat. Hineinzoomen ist ein nützlicher dritter Hinweis: Echter Text bleibt bei jeder Vergrößerung scharf, Text in einem Bild wird weich und pixelig. Prüfen Sie bei gemischten Dokumenten mehrere Seiten, nicht nur die erste. Wenn Sie genau sehen möchten, welchen Text ein PDF enthält, extrahiert ihn PDF in TXT; eine Datei, die leer zurückkommt oder bei bestimmten Seiten leer ist, zeigt Ihnen, wo die Textebene fehlt.

Was OCR tatsächlich macht

Optische Zeichenerkennung verwandelt Bilder von Text zurück in Zeichen. Die Software findet die Textzeilen auf einer Seite, zerlegt sie in Wörter und Buchstaben und vergleicht die erkannten Formen mit einem trainierten Sprachmodell, um die wahrscheinlichsten Zeichen und Wörter auszuwählen. Das Ergebnis ist nicht bloß ein Textstrom, sondern Text mit Positionen, sodass jedes erkannte Wort genau über seinem Bild platziert werden kann. OCR PDF nutzt die Engine Tesseract. Jede Seite wird mit etwa 250 DPI gezeichnet und erkannt, und der erkannte Text wird unsichtbar über die Originalseite gelegt, die ihr eigenes Bild behält. Diese Anordnung wird oft Sandwich-PDF genannt. Bei einer Suche findet der Viewer das verborgene Wort und hebt die Stelle hervor, an der das sichtbare Wort steht, die Seite sieht also unverändert aus, verhält sich aber wie ein digitales Dokument.

Warum die Spracheinstellung wichtig ist

OCR-Engines erkennen Buchstaben nicht isoliert. Sie stützen sich auf Sprachmodelle, die wissen, welche Zeichen es gibt, wie sie sich verbinden und welche Wörter wahrscheinlich sind. Die richtige Sprache zu wählen, verbessert die Genauigkeit enorm: Ein englisches Modell, das einen französischen Brief liest, verstümmelt Akzentbuchstaben und liest unerwartete Wörter falsch, und ein Modell für lateinische Schrift kann Arabisch oder Urdu überhaupt nicht lesen, weil diese Schriften andere Zeichen verwenden und von rechts nach links geschrieben werden. VelloDoc bietet 39 Sprachen, darunter Arabisch, Hebräisch, Hindi, Chinesisch, Japanisch und Koreanisch, und jede Sprache braucht ihre auf dem Server installierten Sprachdaten. Wählen Sie bei gemischtsprachigen Dokumenten die Hauptsprache und fügen Sie die andere als zweite Sprache hinzu. Ist eine Sprache nicht installiert, meldet das Tool dies, statt ein PDF ohne verwertbare Textebene zurückzugeben.

Genaue Ergebnisse aus Scans erhalten

Die meisten OCR-Fehler entscheiden sich bei der Aufnahme der Seite, nicht bei der Erkennung. Die Auflösung zählt: Als Faustregel liefert ein Scan von normalem Drucktext mit etwa 300 DPI genug Details für die Erkennung, sehr kleine Schrift profitiert von mehr. Auch der Kontrast zählt: Dunkler Text auf sauberem weißem Papier wird weit besser erkannt als blasser Text auf grauem oder gemustertem Hintergrund. Gerade Zeilen zählen, weil die Erkennung waagerechte Textzeilen erwartet; PDF begradigen korrigiert leichte Schräglagen vor der Erkennung. Leere Seiten kosten nur Verarbeitungszeit, und Leere Seiten entfernen räumt sie aus. Schatten, gewölbte Seiten nahe dem Buchrücken und Spiegelungen auf Hochglanzpapier sind die häufigsten Probleme bei Handy-Scans; der Ratgeber für sauberere Handy-Scans erklärt, wie Sie sie vermeiden.

Erkannten Text prüfen und korrigieren

Auch gute OCR macht Fehler, und diese Fehler folgen Mustern. Ähnlich aussehende Zeichen werden verwechselt: Die Buchstaben r und n nebeneinander können zu m werden, die Ziffer 0 und der Buchstabe O tauschen die Plätze, und 1, l und I werden leicht vermischt. Text in Tabellen kann in unerwarteter Reihenfolge ausgegeben werden, und mehrspaltige Seiten werden womöglich quer über die Spalten statt spaltenweise gelesen. Namen, Aktenzeichen, Datumsangaben und Beträge verdienen die größte Aufmerksamkeit, denn eine einzige falsche Ziffer ändert ihre Bedeutung und wirkt dabei trotzdem plausibel. Eine praktische Prüfung besteht darin, im OCR-Ergebnis nach mehreren Wörtern und Zahlen zu suchen, die Sie auf der Seite sehen. Bei Dokumenten, bei denen es auf den genauen Wortlaut ankommt, etwa rechtlichen oder finanziellen Unterlagen, betrachten Sie den erkannten Text als Suchhilfe und verlassen Sie sich immer auf das Seitenbild als maßgebliche Fassung.

Durchsuchbar heißt nicht barrierefrei

Eine Textebene ist ein großer Schritt für die Barrierefreiheit, denn Screenreader können die Wörter einer gescannten Seite endlich vorlesen. Ein vollständig barrierefreies PDF braucht aber mehr. Barrierefreie Dokumente enthalten Tags, die die Struktur beschreiben, etwa welcher Text eine Überschrift ist, welcher eine Liste und welches Bild eine Beschreibung braucht, und sie legen eine Lesereihenfolge fest, damit Hilfstechnologien Inhalte in sinnvoller Abfolge wiedergeben. OCR fügt diese Tags nicht hinzu. Der Standard PDF/UA beschreibt, was vollständige Barrierefreiheit verlangt. Brauchen Sie Inhalte, die für alle leicht lesbar sind, auch auf dem Handy, ist die Umwandlung des durchsuchbaren PDFs in eine Webseite mit PDF in HTML ein weiterer praktischer Weg, denn HTML-Text passt sich dem Bildschirm an und arbeitet selbstverständlich mit den Barrierefreiheitsfunktionen des Browsers zusammen.

Wann OCR nicht das richtige Werkzeug ist

OCR ist für Seiten gedacht, die Bilder sind. VelloDoc lässt Seiten, die bereits Text enthalten, unverändert, ein digitales PDF bekommen Sie also einfach unverändert zurück. Es gibt eine wichtige Ausnahme: Manche digitalen PDFs enthalten Text, der normal aussieht, beim Kopieren aber als Zeichensalat herauskommt, weil die Datei Zeichen ohne Angabe speichert, welche Buchstaben sie darstellen. OCR behebt das, indem sie stattdessen die sichtbare Seite liest. Haben Sie das Originaldokument, ist ein daraus neu exportiertes PDF immer besser als ein erkannter Scan. Für Langzeitarchive ist eine sinnvolle Reihenfolge: scannen, bereinigen, OCR ausführen und das Ergebnis dann mit PDF in PDF/A umwandeln, damit das durchsuchbare Dokument über Jahre lesbar bleibt. Der Leitfaden zu den Optimierungs-Tools zeigt, wie diese Schritte zusammenpassen. Für Dokumente in arabischer Schrift lesen Sie die Ratgeber zu OCR für arabische PDFs und OCR für Urdu-PDFs.

Fragen

Warum sehe ich den Text, kann ihn aber nicht durchsuchen?

Die Seite ist ein Bild des Textes und nicht der Text selbst, typisch für Scans und Handyfotos. Führen Sie OCR PDF aus, um eine durchsuchbare Textebene hinzuzufügen.

Verändert OCR das Aussehen meines PDFs?

Nein. VelloDoc behält jede Seite genau bei und legt die erkannten Wörter als unsichtbaren Text darüber.

Kann OCR Handschrift lesen?

Im Allgemeinen nicht zuverlässig. Tesseract ist für gedruckten Text ausgelegt; saubere Druckbuchstaben werden manchmal erkannt, verbundene Schreibschrift meist nicht.

Ist OCR-Text genau genug für rechtliche Dokumente?

Nutzen Sie ihn, um Dokumente zu finden und darin zu navigieren, prüfen Sie Namen, Zahlen und Datumsangaben aber am Seitenbild. Das Bild bleibt die maßgebliche Fassung.

Soll ich OCR auf ein bereits durchsuchbares PDF anwenden?

Nein, es sei denn, sein Text lässt sich nur als Zeichensalat kopieren. OCR auf einem digitalen PDF ersetzt echten Text durch ein Bild und eine verborgene Textebene.

Tools zu diesem Thema