Reiner Text ist die vielseitigste Form, die ein Dokument annehmen kann: Er lässt sich sauber in E-Mails und Formulare einfügen, speist Suchwerkzeuge und Analyseskripte und öffnet sich überall. PDF in TXT extrahiert die Textebene jeder Seite in eine UTF-8-Textdatei, mit Leerzeilen zwischen den Seiten, und lässt Formatierung und Bilder zurück.
So verwenden Sie PDF in TXT
- Fügen Sie die PDF hinzu. Ist es ein Scan, führen Sie zuerst OCR PDF aus.
- Wählen Sie Text extrahieren.
- Laden Sie die TXT-Datei herunter.
- Öffnen Sie sie in einem beliebigen Texteditor.
Was extrahiert wird
VelloDoc liest die Textebene jeder Seite in der Reihenfolge, in der sie in der PDF gespeichert ist, und schreibt sie in eine UTF-8-kodierte Textdatei, sodass Umlaute und nicht-lateinische Schriften erhalten bleiben. Die Seiten folgen aufeinander, jeweils durch eine Leerzeile getrennt. Zeilenumbrüche innerhalb von Absätzen entsprechen meist denen auf der Seite, ein langer Absatz kann also auf mehrere Zeilen verteilt sein, die Sie bei Bedarf wieder zusammenfügen.
Wo die Extraktion an Grenzen stößt
Die Textreihenfolge hängt davon ab, wie die PDF erstellt wurde. Mehrspaltige Layouts können Spalten ineinander verschränken, Kopf- und Fußzeilen wiederholen sich auf jeder Seite, und Text in Tabellen erscheint Zeile für Zeile. Manche PDFs aus ungewöhnlicher Software speichern Zeichen ohne korrekte Zuordnung zu Buchstaben, was trotz normal aussehender Seite zu unlesbarer Ausgabe führt; OCR PDF und eine erneute Extraktion lösen das meist. Scans liefern nichts, bis OCR eine Textebene hinzugefügt hat.
Das Ausgabeformat wählen
Zum Bearbeiten mit Absätzen und Seitenumbrüchen ist PDF in Word praktischer. Als Ausgangspunkt für Dokumentation fügt PDF in Markdown Seitenüberschriften hinzu. Brauchen Sie Tabellen in einer Tabellenkalkulation, teilt PDF in Excel Zeilen in Zellen auf. Der Leitfaden zu durchsuchbaren PDFs erklärt, warum manche PDFs keinen Text zum Extrahieren haben.
Wann PDF in TXT hilft
Aus Berichten zitieren
Kopieren Sie den genauen Wortlaut aus einem langen Bericht, ohne sich mit der umständlichen Textauswahl in PDFs herumzuschlagen.
Text für Analysewerkzeuge aufbereiten
Bereiten Sie Dokumente für Suchindizes, Wortzählungen oder Textanalyseskripte vor, die reinen Text erwarten.
Mit assistiven Technologien lesen
Öffnen Sie den Dokumenttext in einer Lese-App oder einem Großdruck-Editor, der reinen Text besser verarbeitet als PDF.
Grenzen des Tools
PDF in TXT extrahiert nur vorhandenen Text, daher brauchen Scans zuerst OCR. Mehrspaltige Layouts können umsortiert werden, wiederholte Kopf- und Fußzeilen sind enthalten, und sämtliche Formatierung, Tabellen und Bilder entfallen.
PDF in TXT: häufige Fragen
Warum ist meine Textdatei leer?
Die PDF hat keine Textebene, typisch für Scans und Fotos. Führen Sie OCR PDF aus und extrahieren Sie dann erneut.
Warum ist der Text unleserlich?
Manche PDFs speichern Zeichen ohne Information darüber, welche Buchstaben sie darstellen. OCR PDF erzeugt den Text aus dem Seitenbild neu, was das meist behebt.
Bleibt die Formatierung erhalten?
Nein. Eine TXT-Datei enthält nur reine Zeichen, daher gehen Fettschrift, Schriftarten, Tabellen und Bilder verloren.
Welche Kodierung wird verwendet?
Die Datei wird als UTF-8 gespeichert, das jeder moderne Editor liest und das alle Sprachen unterstützt.