Le texte brut est la forme la plus réutilisable qu’un document puisse prendre : il se colle proprement dans les e-mails et les formulaires, alimente les outils de recherche et les scripts d’analyse, et s’ouvre partout. PDF en TXT extrait la couche de texte de chaque page dans un seul fichier texte UTF-8, les pages étant séparées par des lignes vides, en laissant de côté la mise en forme et les images.
Comment utiliser PDF en TXT
- Ajoutez le PDF. S’il s’agit d’une numérisation, passez-le d’abord dans OCR PDF.
- Cliquez sur Extraire le texte.
- Téléchargez le fichier TXT.
- Ouvrez-le dans n’importe quel éditeur de texte.
Ce qui est extrait
VelloDoc lit la couche de texte de chaque page dans l’ordre où elle est stockée dans le PDF et l’écrit dans un fichier texte encodé en UTF-8 : les lettres accentuées et les écritures non latines sont préservées. Les pages se suivent, séparées par une ligne vide. Les retours à la ligne à l’intérieur des paragraphes reprennent généralement ceux de la page : un long paragraphe peut donc être coupé sur plusieurs lignes, que vous pouvez rassembler si besoin.
Là où l’extraction peine
L’ordre du texte dépend de la façon dont le PDF a été construit. Les mises en page sur plusieurs colonnes peuvent entremêler les colonnes, les en-têtes et pieds de page se répètent sur chaque page, et le texte des tableaux apparaît ligne par ligne. Certains PDF produits par des logiciels inhabituels stockent les caractères sans correspondance correcte avec les lettres, ce qui donne un texte incompréhensible alors que la page s’affiche bien ; passer le fichier dans OCR PDF puis relancer l’extraction règle généralement le problème. Les numérisations ne produisent rien tant que l’OCR n’a pas ajouté de couche de texte.
Choisir le format de sortie
Pour modifier le texte avec ses paragraphes et ses sauts de page, PDF en Word est plus pratique. Comme point de départ pour une documentation, PDF en Markdown ajoute des titres de page. Si vous avez besoin de tableaux dans un tableur, PDF en Excel découpe les lignes en cellules. Le guide des PDF interrogeables explique pourquoi certains PDF n’ont aucun texte à extraire.
Quand utiliser PDF en TXT
Citer des rapports
Copiez la formulation exacte d’un long rapport sans vous battre avec la sélection de texte peu pratique d’un PDF.
Alimenter des outils d’analyse
Préparez des documents pour des index de recherche, des comptages de mots ou des scripts d’analyse de texte qui attendent du texte brut.
Lire avec des aides techniques
Ouvrez le texte d’un document dans une application de lecture ou un éditeur en gros caractères qui gère mieux le texte brut que le PDF.
Limites à connaître
PDF en TXT extrait uniquement le texte existant : les numérisations ont d’abord besoin de l’OCR. Les mises en page sur plusieurs colonnes peuvent être réordonnées, les en-têtes et pieds de page répétés sont inclus, et toute la mise en forme, les tableaux et les images sont écartés.
PDF en TXT : questions fréquentes
Pourquoi mon fichier texte est-il vide ?
Le PDF n’a pas de couche de texte, ce qui est typique des numérisations et des photos. Passez-le dans OCR PDF, puis relancez l’extraction.
Pourquoi le texte est-il illisible ?
Certains PDF stockent les caractères sans indiquer quelles lettres ils représentent. OCR PDF recrée le texte à partir de l’image de la page, ce qui règle généralement le problème.
La mise en forme est-elle conservée ?
Non. Un fichier TXT ne contient que des caractères bruts : gras, polices, tableaux et images sont laissés de côté.
Quel encodage est utilisé ?
Le fichier est enregistré en UTF-8, que tous les éditeurs modernes savent lire et qui prend en charge toutes les langues.