VelloDoc
Convertir desde PDF

PDF a TXT

Saca todo el texto legible de un PDF a un archivo de texto plano UTF-8 para buscar, citar, analizar o mejorar la accesibilidad. Los PDF escaneados necesitan OCR antes.

Elegir archivos

Suelta los archivos aquí o haz clic para buscarlos


Acepta: PDFMáx. 80 MBEliminado tras la entrega

Herramientas relacionadas

Los siguientes pasos más habituales después de esta.

El texto plano es la forma más reutilizable que puede tener un documento: se pega limpio en correos y formularios, alimenta herramientas de búsqueda y scripts de análisis y se abre en cualquier cosa. PDF a TXT extrae la capa de texto de cada página a un único archivo de texto UTF-8, con las páginas separadas por líneas en blanco, y deja atrás el formato y las imágenes.

Cómo usar PDF a TXT

  1. Añade el PDF. Si es un escaneo, pásale antes OCR PDF.
  2. Pulsa Extraer texto.
  3. Descarga el archivo TXT.
  4. Ábrelo en cualquier editor de texto.

Qué se extrae

VelloDoc lee la capa de texto de cada página en el orden en que está guardada en el PDF y la escribe en un archivo de texto codificado en UTF-8, así que se conservan las letras con tilde y las escrituras no latinas. Las páginas van una tras otra, separadas por una línea en blanco. Los saltos de línea dentro de los párrafos suelen reproducir los de la página, así que un párrafo largo puede quedar dividido en varias líneas que puedes volver a unir si hace falta.

Dónde tiene problemas la extracción

El orden del texto depende de cómo se creó el PDF. Los diseños a varias columnas pueden intercalar las columnas, los encabezados y pies se repiten en cada página y el texto de las tablas aparece línea a línea. Algunos PDF creados con programas poco habituales guardan los caracteres sin una correspondencia correcta con las letras, lo que produce un resultado ilegible aunque la página se vea bien; pasar OCR PDF y volver a extraer suele solucionarlo. Los escaneos no producen nada hasta que el OCR añade una capa de texto.

Elegir el formato de salida

Para editar con párrafos y saltos de página, PDF a Word es más cómodo. Como punto de partida para documentación, PDF a Markdown añade títulos de página. Si necesitas tablas en una hoja de cálculo, PDF a Excel divide las filas en celdas. La guía de PDF buscables explica por qué algunos PDF no tienen texto que extraer.

Cuándo se usa PDF a TXT

Citar informes

Copia la redacción exacta de un informe largo sin pelearte con la incómoda selección de texto de un PDF.

Alimentar herramientas de análisis

Prepara documentos para índices de búsqueda, recuentos de palabras o scripts de análisis de texto que esperan texto plano.

Leer con tecnologías de apoyo

Abre el texto del documento en una aplicación de lectura o en un editor de letra grande que maneja el texto plano mejor que el PDF.

Limitaciones que conviene conocer

PDF a TXT solo extrae el texto existente, así que los escaneos necesitan OCR antes. Los diseños a varias columnas pueden reordenarse, se incluyen los encabezados y pies repetidos, y se pierden todo el formato, las tablas y las imágenes.

PDF a TXT: preguntas frecuentes

¿Por qué mi archivo de texto está vacío?

El PDF no tiene capa de texto, algo típico de escaneos y fotos. Pasa OCR PDF y vuelve a extraer.

¿Por qué el texto sale ilegible?

Algunos PDF guardan los caracteres sin información sobre qué letras representan. OCR PDF vuelve a crear el texto a partir de la imagen de la página, lo que normalmente lo soluciona.

¿Se conserva el formato?

No. Un archivo TXT solo contiene caracteres sin formato, así que la negrita, las fuentes, las tablas y las imágenes se pierden.

¿Qué codificación se usa?

El archivo se guarda en UTF-8, que leen todos los editores modernos y que admite todos los idiomas.

Más información