VelloDoc
PDF optimieren

OCR PDF

Fügen Sie gescannten PDFs per OCR in 39 Sprachen eine durchsuchbare, markierbare Textebene hinzu. Die Seiten behalten ihr Aussehen, und der Text lässt sich auch exportieren.

Dateien auswählen

Dateien hier ablegen oder zum Durchsuchen klicken


Akzeptiert: PDFMax. 80 MBNach Auslieferung gelöscht

Erkennt 39 Sprachen, zwei gleichzeitig. Prüfen Sie den erkannten Text, bevor Sie sich darauf verlassen.

Verwandte Tools

Typische nächste Schritte nach diesem Tool.

Ein gescanntes PDF sieht aus wie ein Dokument, verhält sich aber wie ein Foto: Sie können es nicht durchsuchen, keinen Satz daraus kopieren und es nicht von einem Screenreader vorlesen lassen. Optische Zeichenerkennung behebt das. OCR PDF liest die Wörter jeder Seite und legt sie als unsichtbaren Text darüber – die Seite sieht genauso aus wie vorher, lässt sich aber durchsuchen, markieren und indexieren. Es liest 39 Sprachen, zwei gleichzeitig bei gemischtsprachigen Dokumenten, und kann Ihnen den Text auch als eigene Datei liefern.

So verwenden Sie OCR PDF

  1. Fügen Sie das gescannte PDF hinzu. Begradigen Sie schiefe Seiten vorher mit PDF begradigen, das verbessert die Genauigkeit.
  2. Wählen Sie die Sprache des Dokuments und eine zweite Sprache, wenn die Seiten zwei mischen.
  3. Wählen Sie durchsuchbares PDF oder Textdatei und dann OCR starten.
  4. Laden Sie das Ergebnis herunter und testen Sie es, indem Sie nach einem Wort suchen, das Sie auf einer Seite sehen.

So entsteht die durchsuchbare Ebene

Jede Seite wird mit 250 DPI gezeichnet, und die Engine Tesseract findet darin die Wörter. Diese werden dann als unsichtbarer Text auf die Originalseite gelegt, an denselben Stellen wie die Wörter, die Sie sehen. Der Scan behält seine eigene Auflösung, und echter Text, Zeichnungen oder Links auf der Seite bleiben, wie sie waren – nur die unsichtbare Ebene kommt hinzu. Seiten, die schon Text enthalten, getippt oder aus einer früheren OCR, bleiben unverändert, sodass eine zweite OCR den Text nicht verdoppelt.

Die richtige Sprache wählen

OCR erkennt Zeichen mit dem Modell einer bestimmten Sprache, daher ist die Wahl der Dokumentsprache wichtiger als jede andere Einstellung. Zur Auswahl stehen 39 Sprachen, darunter Arabisch, vereinfachtes und traditionelles Chinesisch, Griechisch, Hebräisch, Hindi, Japanisch, Koreanisch, Russisch, Thailändisch, Türkisch, Ukrainisch, Urdu und Vietnamesisch sowie die wichtigsten europäischen Sprachen. Bei gemischtsprachigen Dokumenten, etwa einem französischen Vertrag mit englischem Anhang, wählen Sie eine zweite Sprache, dann werden beide Modelle zusammen genutzt. Mit dem falschen Modell verliert ein französischer Brief, als Englisch gelesen, seine Akzente, und Wörter werden falsch gelesen. Für Scans in arabischer Schrift erklären die Ratgeber zu arabischer OCR und Urdu-OCR, wie Sie den Scan vorbereiten und welche Genauigkeit Sie erwarten können.

Genaue Ergebnisse erzielen

Die Erkennung ist nur so gut wie der Scan. Gerade, gleichmäßig beleuchtete Seiten mit gutem Kontrast funktionieren am besten, und PDF begradigen hilft bei schiefen Seiten. Kleine Schrift, Handschrift, Stempel über dem Text und mehrspaltige Layouts sind die typischen Fehlerquellen, prüfen Sie also Namen, Zahlen und Daten. Wählen Sie Textdatei, um die erkannten Wörter Seite für Seite als .txt zu erhalten, oder machen Sie mit PDF in Word weiter, um ein bearbeitbares Dokument zu bekommen. Der Ratgeber zu durchsuchbaren PDFs erklärt Textebenen im Detail.

Wann OCR PDF hilft

Durchsuchbare Dokumentarchive

Machen Sie Jahrgänge gescannter Briefe und Auszüge per Stichwort auffindbar, statt Dateien einzeln zu öffnen.

Text aus einem Scan kopieren

Markieren und kopieren Sie einen Absatz, eine Adresse oder eine Referenznummer von einer gescannten Seite, statt sie abzutippen.

Lesbar für Screenreader

Eine Textebene erlaubt Screenreadern, gescannte Seiten vorzulesen – der erste Schritt zu einem barrierefreien Dokument.

Grenzen des Tools

OCR PDF erkennt gedruckten Text in 39 Sprachen, bis zu zwei pro Auftrag, und benötigt Tesseract mit den passenden Sprachdaten auf dem Server. Seiten, die bereits Text enthalten, bleiben unverändert. Rechnen Sie mit Erkennungsfehlern bei kleiner Schrift, Handschrift und komplexen Layouts, und prüfen Sie Namen, Zahlen und Daten.

OCR PDF: häufige Fragen

Woran erkenne ich, ob mein PDF OCR braucht?

Versuchen Sie, ein Wort mit dem Cursor zu markieren, oder suchen Sie nach einem Wort, das Sie sehen. Wird nichts gefunden oder können Sie nur einen Rahmen über die Seite ziehen, ist der Text Teil eines Bildes, und OCR hilft.

Verändert OCR das Aussehen des Dokuments?

Nein. Jede Seite bleibt, wie sie war, samt Bildqualität, und die erkannten Wörter werden als unsichtbarer Text darübergelegt.

Kann OCR Handschrift lesen?

Tesseract ist für gedruckten Text gemacht. Saubere Druckbuchstaben werden manchmal erkannt, verbundene Schreibschrift meist nicht, verlassen Sie sich bei handschriftlichen Notizen also nicht auf OCR.

Kann ich nur den Text bekommen?

Ja. Wählen Sie Textdatei als Ergebnis, dann erhalten Sie die erkannten Wörter Seite für Seite als .txt-Datei. Seiten, die schon Text hatten, liefern diesen Text unverändert.

Warum meldet OCR, dass eine Sprache nicht installiert ist?

Jede Sprache braucht ihre Tesseract-Sprachdaten auf dem Server. Fehlen sie, sagt VelloDoc das, statt eine Datei ohne Textebene zurückzugeben.

Mehr erfahren