VelloDoc
Convertir un PDF

PDF en TXT

Récupérez tout le texte lisible d’un PDF dans un fichier texte brut UTF-8, pour la recherche, les citations, l’analyse ou l’accessibilité. Les PDF numérisés ont d’abord besoin de l’OCR.

Choisir des fichiers

Déposez les fichiers ici ou cliquez pour parcourir


Formats acceptés : PDFMax. 80 MoSupprimé après livraison

Outils associés

Les étapes suivantes les plus courantes après celui-ci.

Le texte brut est la forme la plus réutilisable qu’un document puisse prendre : il se colle proprement dans les e-mails et les formulaires, alimente les outils de recherche et les scripts d’analyse, et s’ouvre partout. PDF en TXT extrait la couche de texte de chaque page dans un seul fichier texte UTF-8, les pages étant séparées par des lignes vides, en laissant de côté la mise en forme et les images.

Comment utiliser PDF en TXT

  1. Ajoutez le PDF. S’il s’agit d’une numérisation, passez-le d’abord dans OCR PDF.
  2. Cliquez sur Extraire le texte.
  3. Téléchargez le fichier TXT.
  4. Ouvrez-le dans n’importe quel éditeur de texte.

Ce qui est extrait

VelloDoc lit la couche de texte de chaque page dans l’ordre où elle est stockée dans le PDF et l’écrit dans un fichier texte encodé en UTF-8 : les lettres accentuées et les écritures non latines sont préservées. Les pages se suivent, séparées par une ligne vide. Les retours à la ligne à l’intérieur des paragraphes reprennent généralement ceux de la page : un long paragraphe peut donc être coupé sur plusieurs lignes, que vous pouvez rassembler si besoin.

Là où l’extraction peine

L’ordre du texte dépend de la façon dont le PDF a été construit. Les mises en page sur plusieurs colonnes peuvent entremêler les colonnes, les en-têtes et pieds de page se répètent sur chaque page, et le texte des tableaux apparaît ligne par ligne. Certains PDF produits par des logiciels inhabituels stockent les caractères sans correspondance correcte avec les lettres, ce qui donne un texte incompréhensible alors que la page s’affiche bien ; passer le fichier dans OCR PDF puis relancer l’extraction règle généralement le problème. Les numérisations ne produisent rien tant que l’OCR n’a pas ajouté de couche de texte.

Choisir le format de sortie

Pour modifier le texte avec ses paragraphes et ses sauts de page, PDF en Word est plus pratique. Comme point de départ pour une documentation, PDF en Markdown ajoute des titres de page. Si vous avez besoin de tableaux dans un tableur, PDF en Excel découpe les lignes en cellules. Le guide des PDF interrogeables explique pourquoi certains PDF n’ont aucun texte à extraire.

Quand utiliser PDF en TXT

Citer des rapports

Copiez la formulation exacte d’un long rapport sans vous battre avec la sélection de texte peu pratique d’un PDF.

Alimenter des outils d’analyse

Préparez des documents pour des index de recherche, des comptages de mots ou des scripts d’analyse de texte qui attendent du texte brut.

Lire avec des aides techniques

Ouvrez le texte d’un document dans une application de lecture ou un éditeur en gros caractères qui gère mieux le texte brut que le PDF.

Limites à connaître

PDF en TXT extrait uniquement le texte existant : les numérisations ont d’abord besoin de l’OCR. Les mises en page sur plusieurs colonnes peuvent être réordonnées, les en-têtes et pieds de page répétés sont inclus, et toute la mise en forme, les tableaux et les images sont écartés.

PDF en TXT : questions fréquentes

Pourquoi mon fichier texte est-il vide ?

Le PDF n’a pas de couche de texte, ce qui est typique des numérisations et des photos. Passez-le dans OCR PDF, puis relancez l’extraction.

Pourquoi le texte est-il illisible ?

Certains PDF stockent les caractères sans indiquer quelles lettres ils représentent. OCR PDF recrée le texte à partir de l’image de la page, ce qui règle généralement le problème.

La mise en forme est-elle conservée ?

Non. Un fichier TXT ne contient que des caractères bruts : gras, polices, tableaux et images sont laissés de côté.

Quel encodage est utilisé ?

Le fichier est enregistré en UTF-8, que tous les éditeurs modernes savent lire et qui prend en charge toutes les langues.

En savoir plus