Warum Arabisch für OCR schwieriger ist
Arabisch wird von rechts nach links in einer verbundenen Schrift geschrieben: Die meisten Buchstaben verbinden sich mit ihren Nachbarn und haben am Anfang, in der Mitte oder am Ende eines Wortes oder allein stehend eine andere Form. Mehrere Buchstaben teilen dieselbe Grundform und unterscheiden sich nur durch Anzahl und Lage ihrer Punkte, etwa ب, ت und ث, ein Staubkorn oder ein fehlender Punkt kann also ein Wort verändern. Viele Texte lassen außerdem die Zeichen für kurze Vokale weg, während religiöse, poetische und Lehrtexte sie vollständig enthalten können, mit kleinen Zeichen über und unter der Zeile. Zahlen und lateinische Wörter laufen innerhalb von Sätzen, die von rechts nach links gehen, von links nach rechts. Eine OCR-Engine muss verbundene Buchstaben trennen, jeden Punkt und jedes Zeichen erhalten und alles in die richtige Reihenfolge bringen, deshalb ist die Scanqualität bei Arabisch noch wichtiger als bei Englisch.
Wie VelloDoc arabischen Text erkennt
OCR PDF nutzt die Open-Source-Engine Tesseract mit ihren arabischen Sprachdaten. Wenn Sie Arabisch als OCR-Sprache wählen, wird jede Seite mit etwa 250 DPI gezeichnet, Tesseract findet die Wörter darauf, und der erkannte Text wird unsichtbar über die Wörter der Originalseite gelegt. Die Seite sieht gleich aus, doch Sie können ihren Text jetzt durchsuchen, markieren und kopieren. In diesem Ratgeber startet das Tool oben bereits mit ausgewähltem Arabisch. Wählen Sie bei einem Dokument, das Arabisch und Englisch mischt, Arabisch und fügen Sie Englisch als zweite Sprache hinzu, damit beide erkannt werden. Seiten, die bereits markierbaren Text enthalten, bleiben unverändert, in einer gemischten Datei werden also nur die gescannten Seiten gelesen.
Arabische Dokumente für bessere Erkennung scannen
Beginnen Sie mit der schärfsten und glattesten Seite, die Sie bekommen können. Am Scanner sind 300 DPI in Graustufen eine gute Standardeinstellung für gedrucktes Arabisch; sehr kleine Schrift oder vollständig vokalisierter Text kann von einer höheren Auflösung profitieren, solange das Ergebnis scharf bleibt. Auch wenn die Seiten für die Erkennung mit etwa 250 DPI neu gezeichnet werden, zählt eine saubere Vorlage, denn Unschärfe, Rauschen und Schatten wirken sich durch. Füllen Sie mit dem Handy das Bild mit der Seite, halten Sie die Kamera parallel zum Papier und sorgen Sie für gleichmäßiges Licht ohne Schatten über dem Text. Scan zu PDF fügt Handyfotos zu einem PDF zusammen, erkennt aber keine Seitenränder und korrigiert keine Perspektive, schneiden Sie Ihre Aufnahmen daher vorher zu und richten Sie sie gerade aus. Der Ratgeber für sauberere Handy-Scans behandelt Licht und Bildausschnitt ausführlich.
Seiten vor der OCR begradigen
Schräge Zeilen verwirren die Erkennung, und verbundene arabische Buchstaben sind besonders empfindlich, weil die Engine der Linie folgt, auf der die Buchstaben sitzen. PDF begradigen erkennt den Winkel jeder Seite und richtet sie automatisch gerade aus. Die Reihenfolge zählt: Tesseract liest waagerechte Zeilen weit zuverlässiger als schräge. Begradigen Sie zuerst und führen Sie OCR dann auf der begradigten Datei aus. Enthält ein Dokument leere Rückseiten aus einem Duplex-Scan, entfernen Sie diese vor der Erkennung mit Leere Seiten entfernen, das spart Zeit und vermeidet leere Seiten im Ergebnis.
Erkannten Text prüfen und weiterverwenden
Öffnen Sie das Ergebnis und suchen Sie nach einigen Wörtern, die Sie auf der Seite sehen, etwa einem Namen oder einem Ort. Findet die Suche sie, funktioniert die Textebene. Prüfen Sie dann die wichtigsten Details, denn OCR-Fehler sind selten offensichtlich: ähnliche Buchstaben, die sich nur durch Punkte unterscheiden, Endbuchstaben wie ة und ه oder ي und ى, Datumsangaben und Zahlen. PDF-Viewer behandeln rechtsläufigen Text in einer unsichtbaren Ebene unterschiedlich, kopierter Text kann in manchen Anwendungen also in falscher Reihenfolge erscheinen; ein anderer Viewer hilft oft. Um mit dem Text selbst zu arbeiten, speichert PDF in TXT ihn als reine Textdatei, die Sie in jedem Editor mit Arabisch-Unterstützung öffnen können, und PDF in Word gewinnt ihn als bearbeitbares Dokument ohne das ursprüngliche Layout zurück.
Dokumente, mit denen OCR Mühe haben wird
Manches Material übersteigt einfach, was eine allgemeine OCR zuverlässig lesen kann. Handschrift, dekorative Kalligrafie, sehr alte oder beschädigte Drucke und blasse Fotokopien liefern meist viele Fehler oder gar keinen Text. Stempel und Unterschriften über dem Text verdecken Buchstaben, Tabellen und mehrspaltige Layouts können in falscher Reihenfolge gelesen werden, und vollständig vokalisierter Text kann seine Zeichen verlieren oder verschieben. Bei solchen Dokumenten hilft die durchsuchbare Ebene immerhin, die richtige Seite zu finden, wichtige Passagen sollten aber am Bild geprüft oder neu abgetippt werden. Der Ratgeber zu durchsuchbaren PDFs erklärt Textebenen und wann OCR das richtige Werkzeug ist.
Fragen
Kann VelloDoc arabische Handschrift lesen?
Nicht zuverlässig. Die arabischen Sprachdaten sind für gedruckten Text ausgelegt, Handschrift liefert daher meist viele Fehler oder gar keinen Text.
Warum wirkt kopierter arabischer Text umgedreht oder zerstückelt?
PDF-Viewer behandeln rechtsläufigen Text in unsichtbaren Textebenen unterschiedlich. Probieren Sie einen anderen Viewer, oder extrahieren Sie den Text mit PDF in TXT und öffnen Sie ihn in einem Editor mit Arabisch-Unterstützung.
Wähle ich bei einem gemischten Dokument Arabisch oder Englisch?
Wählen Sie Arabisch und fügen Sie Englisch als zweite Sprache hinzu. Dann werden beide zusammen genutzt, und englische Wörter im Dokument werden viel zuverlässiger gelesen.
Verändert OCR das Aussehen meiner Seiten?
Nein. Die Seiten behalten ihr eigenes Bild, und der erkannte Text wird als unsichtbare Ebene darübergelegt. Seiten, die bereits markierbaren Text enthalten, bleiben unverändert.
Mit welcher Auflösung soll ich scannen?
300 DPI sind eine gute Standardeinstellung für gedrucktes Arabisch. Sehr kleine Schrift oder vollständig vokalisierter Text kann von einer höheren Auflösung profitieren, solange der Scan scharf bleibt.