VelloDoc
PDF umwandeln

PDF in TXT

Holen Sie allen lesbaren Text aus einer PDF in eine reine UTF-8-Textdatei, zum Suchen, Zitieren, Analysieren oder für Barrierefreiheit. Gescannte PDFs brauchen zuerst OCR.

Dateien auswählen

Dateien hier ablegen oder zum Durchsuchen klicken


Akzeptiert: PDFMax. 80 MBNach Auslieferung gelöscht

Verwandte Tools

Typische nächste Schritte nach diesem Tool.

Reiner Text ist die vielseitigste Form, die ein Dokument annehmen kann: Er lässt sich sauber in E-Mails und Formulare einfügen, speist Suchwerkzeuge und Analyseskripte und öffnet sich überall. PDF in TXT extrahiert die Textebene jeder Seite in eine UTF-8-Textdatei, mit Leerzeilen zwischen den Seiten, und lässt Formatierung und Bilder zurück.

So verwenden Sie PDF in TXT

  1. Fügen Sie die PDF hinzu. Ist es ein Scan, führen Sie zuerst OCR PDF aus.
  2. Wählen Sie Text extrahieren.
  3. Laden Sie die TXT-Datei herunter.
  4. Öffnen Sie sie in einem beliebigen Texteditor.

Was extrahiert wird

VelloDoc liest die Textebene jeder Seite in der Reihenfolge, in der sie in der PDF gespeichert ist, und schreibt sie in eine UTF-8-kodierte Textdatei, sodass Umlaute und nicht-lateinische Schriften erhalten bleiben. Die Seiten folgen aufeinander, jeweils durch eine Leerzeile getrennt. Zeilenumbrüche innerhalb von Absätzen entsprechen meist denen auf der Seite, ein langer Absatz kann also auf mehrere Zeilen verteilt sein, die Sie bei Bedarf wieder zusammenfügen.

Wo die Extraktion an Grenzen stößt

Die Textreihenfolge hängt davon ab, wie die PDF erstellt wurde. Mehrspaltige Layouts können Spalten ineinander verschränken, Kopf- und Fußzeilen wiederholen sich auf jeder Seite, und Text in Tabellen erscheint Zeile für Zeile. Manche PDFs aus ungewöhnlicher Software speichern Zeichen ohne korrekte Zuordnung zu Buchstaben, was trotz normal aussehender Seite zu unlesbarer Ausgabe führt; OCR PDF und eine erneute Extraktion lösen das meist. Scans liefern nichts, bis OCR eine Textebene hinzugefügt hat.

Das Ausgabeformat wählen

Zum Bearbeiten mit Absätzen und Seitenumbrüchen ist PDF in Word praktischer. Als Ausgangspunkt für Dokumentation fügt PDF in Markdown Seitenüberschriften hinzu. Brauchen Sie Tabellen in einer Tabellenkalkulation, teilt PDF in Excel Zeilen in Zellen auf. Der Leitfaden zu durchsuchbaren PDFs erklärt, warum manche PDFs keinen Text zum Extrahieren haben.

Wann PDF in TXT hilft

Aus Berichten zitieren

Kopieren Sie den genauen Wortlaut aus einem langen Bericht, ohne sich mit der umständlichen Textauswahl in PDFs herumzuschlagen.

Text für Analysewerkzeuge aufbereiten

Bereiten Sie Dokumente für Suchindizes, Wortzählungen oder Textanalyseskripte vor, die reinen Text erwarten.

Mit assistiven Technologien lesen

Öffnen Sie den Dokumenttext in einer Lese-App oder einem Großdruck-Editor, der reinen Text besser verarbeitet als PDF.

Grenzen des Tools

PDF in TXT extrahiert nur vorhandenen Text, daher brauchen Scans zuerst OCR. Mehrspaltige Layouts können umsortiert werden, wiederholte Kopf- und Fußzeilen sind enthalten, und sämtliche Formatierung, Tabellen und Bilder entfallen.

PDF in TXT: häufige Fragen

Warum ist meine Textdatei leer?

Die PDF hat keine Textebene, typisch für Scans und Fotos. Führen Sie OCR PDF aus und extrahieren Sie dann erneut.

Warum ist der Text unleserlich?

Manche PDFs speichern Zeichen ohne Information darüber, welche Buchstaben sie darstellen. OCR PDF erzeugt den Text aus dem Seitenbild neu, was das meist behebt.

Bleibt die Formatierung erhalten?

Nein. Eine TXT-Datei enthält nur reine Zeichen, daher gehen Fettschrift, Schriftarten, Tabellen und Bilder verloren.

Welche Kodierung wird verwendet?

Die Datei wird als UTF-8 gespeichert, das jeder moderne Editor liest und das alle Sprachen unterstützt.

Mehr erfahren