VelloDoc
Scannen und OCR

So machen Sie ein gescanntes Urdu-PDF mit OCR durchsuchbar

Urdu-Dokumente werden oft als Scans weitergegeben: Gerichtsakten, Schulunterlagen, Behördenbriefe, Zeitungsausschnitte und alte Bücher. Ein Scan lässt sich erst durchsuchen oder kopieren, wenn sein Text erkannt wurde. Urdu bringt eine besondere Herausforderung mit, denn gedrucktes Urdu verwendet meist den Nastaliq-Stil, dessen schräg verlaufende, überlappende Buchstaben für Software viel schwerer zu lesen sind als der aufrechte Naskh-Stil, der im arabischen Druck üblich ist. Dieser Ratgeber erklärt, was Sie von Urdu-OCR erwarten können, wie Sie Seiten vorbereiten und wie Sie das Beste aus dem Ergebnis herausholen.

Von VelloDocAktualisiert am Lesezeit: 7 Min.

Jetzt ausprobieren: OCR PDF

Wörter auf gescannten Seiten erkennen und eine unsichtbare Textebene hinzufügen, damit die PDF-Datei durchsucht und kopiert werden kann.

Vollständige Seite öffnen: OCR PDF

Dateien auswählen

Dateien hier ablegen oder zum Durchsuchen klicken


Akzeptiert: PDFMax. 80 MBNach Auslieferung gelöscht

Erkennt 39 Sprachen, zwei gleichzeitig. Prüfen Sie den erkannten Text, bevor Sie sich darauf verlassen.

Nastaliq und warum es für OCR wichtig ist

Nastaliq ist ein fließender, kalligrafischer Stil. Statt auf einer geraden Linie zu stehen, fallen die Buchstaben eines Wortes von rechts nach links schräg ab, verbundene Buchstaben stapeln und überlappen sich, und Punkte drängen sich in den kleinen Zwischenräumen. Wörter bestehen oft aus mehreren getrennten Gruppen verbundener Buchstaben, sodass Lücken innerhalb eines Wortes wie Lücken zwischen Wörtern aussehen können. Jedes dieser Merkmale erschwert es einer OCR-Engine, Buchstaben zu trennen, ihre Punkte zu erhalten und zu entscheiden, wo Wörter beginnen und enden. Dokumente in einer Urdu-Schrift im Naskh-Stil, wie sie manche Formulare und digitale Dokumente verwenden, werden in der Regel besser erkannt als traditioneller Nastaliq-Druck. Es lohnt sich zu wissen, welchen Stil Sie vor sich haben, bevor Sie die Ergebnisse beurteilen.

So funktioniert die Urdu-OCR von VelloDoc

OCR PDF nutzt die Open-Source-Engine Tesseract mit ihren Urdu-Sprachdaten. Wenn Sie Urdu wählen, wird jede Seite mit etwa 250 DPI gezeichnet, die Wörter werden erkannt, und der erkannte Text wird unsichtbar über die Originalseite gelegt, die Seite sieht also gleich aus, lässt sich aber durchsuchen und kopieren. In diesem Ratgeber startet das Tool oben bereits mit ausgewähltem Urdu. Wählen Sie für Urdu-Dokumente Urdu und nicht Arabisch: Urdu verwendet Buchstaben, die es im Arabischen nicht gibt, etwa ٹ, ڈ, ڑ, ں und ے, und die Urdu-Daten basieren auf Urdu-Wörtern. Enthält ein Urdu-Dokument englische Wörter, fügen Sie Englisch als zweite Sprache hinzu, damit beide Schriften erkannt werden.

Urdu-Scans vorbereiten

Die kleinen, gedrängten Details von Nastaliq sind das Erste, was ein schlechter Scan zerstört, geben Sie der Engine also so viel Klarheit wie möglich. Scannen Sie gedruckte Seiten mit 300 DPI oder mehr in Graustufen, halten Sie die Seiten flach, damit sich die Zeilen nahe dem Buchrücken nicht wölben, und reinigen Sie das Scannerglas. Fotografieren Sie mit dem Handy jede Seite gerade von oben bei gleichmäßigem Licht, füllen Sie das Bild mit dem Papier und vermeiden Sie Schatten. Komprimieren Sie Scans nicht vor der Erkennung: Starke JPEG-Komprimierung verwischt die Punkte und Verbindungen, an denen sich Buchstaben unterscheiden. Führen Sie OCR mit der besten Fassung aus, die Sie haben, und komprimieren Sie die fertige Datei danach, falls sie kleiner werden muss.

Eine verlässliche Reihenfolge der Schritte

Für einen Stapel gescannter Seiten ist diese Abfolge bewährt: Fassen Sie Handyfotos mit Scan zu PDF zu einer Datei zusammen oder beginnen Sie mit dem PDF Ihres Scanners; entfernen Sie leere Rückseiten von Duplex-Scans mit Leere Seiten entfernen; begradigen Sie schiefe Seiten mit PDF begradigen; führen Sie dann OCR aus. Halten Sie diese Reihenfolge ein, denn waagerechte Zeilen der Urdu-Schrift werden weit zuverlässiger erkannt als schräge. Prüfen Sie zum Schluss das Ergebnis und verkleinern Sie es bei Bedarf mit PDF komprimieren.

Erkannten Urdu-Text prüfen und bearbeiten

Suchen Sie im Ergebnis nach einigen Wörtern, die Sie auf der Seite sehen. Rechnen Sie damit, dass manche Suchen ins Leere laufen, obwohl das Wort vorhanden ist, denn schon ein falsch gelesener Buchstabe verhindert den Treffer. Prüfen Sie Namen, Zahlen und Datumsangaben sorgfältig; Urdu-Dokumente können ostarabisch-indische Ziffern verwenden, deren Erkennung unterschiedlich ausfallen kann. Zum Bearbeiten gewinnt PDF in Word den Text als bearbeitbares Dokument zurück, und PDF in TXT speichert ihn als reinen Text. Öffnen Sie beides in einem Programm, das rechtsläufigen Urdu-Text unterstützt, und planen Sie Zeit für Korrekturen ein. Viewer behandeln rechtsläufigen Text in unsichtbaren Ebenen unterschiedlich; wirkt kopierter Text durcheinander, probieren Sie eine andere Anwendung.

Wenn OCR nicht die richtige Antwort ist

Allgemeine OCR ist nicht für Handschrift, dekorative Kalligrafie, blasse Durchschläge oder stark beschädigte Seiten gebaut, und in verzierten Stilen gesetzte Urdu-Poesie ist besonders schwierig. Bei solchem Material hilft die durchsuchbare Ebene womöglich noch, die richtige Seite zu finden, der Text selbst ist aber nicht verlässlich. Kommt es auf Genauigkeit an, etwa bei juristischen oder wissenschaftlichen Zitaten, vergleichen Sie erkannte Passagen mit dem Seitenbild oder tippen Sie sie neu ab. Der Ratgeber zu durchsuchbaren PDFs erklärt Textebenen, und der Ratgeber zur arabischen OCR behandelt die verwandten Herausforderungen des arabischen Drucks.

Fragen

Wähle ich für Urdu-Text Urdu oder Arabisch?

Wählen Sie Urdu. Urdu verwendet Buchstaben, die es im Arabischen nicht gibt, und die Urdu-Sprachdaten basieren auf Urdu-Wörtern.

Warum enthält mein erkannter Urdu-Text so viele Fehler?

Nastaliq-Druck ist für OCR-Engines schwierig, und kleine Schrift, geringe Auflösung, Schräglage und Rauschen erhöhen die Fehlerzahl. Scannen Sie erneut mit 300 DPI oder mehr, begradigen Sie die Seiten mit PDF begradigen und prüfen Sie das Ergebnis sorgfältig.

Kann ich den Urdu-Text nach der OCR bearbeiten?

Ja. Extrahieren Sie ihn mit PDF in Word oder PDF in TXT und bearbeiten Sie ihn in einem Programm, das rechtsläufigen Text unterstützt. Rechnen Sie damit, einige Erkennungsfehler korrigieren zu müssen.

Funktioniert OCR bei handschriftlichem Urdu?

Im Allgemeinen nicht. Die Sprachdaten sind für gedruckten Text ausgelegt, Handschrift liefert daher unzuverlässige Ergebnisse.

Wird mein Dokument nach der OCR aufbewahrt?

Nein. Die Datei wird in einem temporären Auftragsordner verarbeitet und nach der Auslieferung des Ergebnisses gelöscht. Die Seite zur Dateisicherheit erklärt die Einzelheiten.

Tools zu diesem Thema