VelloDoc
Converter de PDF

PDF para TXT

Tire todo o texto legível de um PDF para um arquivo de texto simples em UTF-8, para pesquisar, citar, analisar ou melhorar a acessibilidade. PDFs digitalizados precisam de OCR antes.

Escolher arquivos

Solte os arquivos aqui ou clique para procurar


Aceita: PDFMáx. 80 MBExcluído após a entrega

Ferramentas relacionadas

Próximos passos comuns depois desta.

Texto simples é a forma mais reaproveitável que um documento pode ter: cola limpo em e-mails e formulários, alimenta ferramentas de busca e scripts de análise e abre em qualquer coisa. PDF para TXT extrai a camada de texto de cada página para um único arquivo de texto UTF-8, com as páginas separadas por linhas em branco, deixando formatação e imagens para trás.

Como usar: PDF para TXT

  1. Adicione o PDF. Se for uma digitalização, passe antes pelo OCR PDF.
  2. Clique em Extrair texto.
  3. Baixe o arquivo TXT.
  4. Abra em qualquer editor de texto.

O que é extraído

O VelloDoc lê a camada de texto de cada página na ordem em que está guardada no PDF e grava em um arquivo de texto codificado em UTF-8, então letras acentuadas e escritas não latinas são preservadas. As páginas vêm uma depois da outra, separadas por uma linha em branco. As quebras de linha dentro dos parágrafos costumam repetir as quebras da página, então um parágrafo longo pode ficar dividido em várias linhas, que você pode juntar de novo se precisar.

Onde a extração tem dificuldade

A ordem do texto depende de como o PDF foi criado. Layouts com várias colunas podem misturar as colunas, cabeçalhos e rodapés se repetem em todas as páginas, e o texto de tabelas aparece linha por linha. Alguns PDFs feitos por programas incomuns guardam os caracteres sem um mapeamento correto para as letras, o que gera um resultado embaralhado mesmo que a página pareça normal; passar pelo OCR PDF e extrair de novo costuma resolver. Digitalizações não geram nada até que o OCR adicione uma camada de texto.

Escolhendo o formato de saída

Para editar com parágrafos e quebras de página, o PDF para Word é mais prático. Como ponto de partida para documentação, o PDF para Markdown adiciona títulos de página. Se você precisa de tabelas em uma planilha, o PDF para Excel divide as linhas em células. O guia de PDF pesquisável explica por que alguns PDFs não têm texto para extrair.

Quando usar: PDF para TXT

Citar relatórios

Copie a redação exata de um relatório longo sem brigar com a seleção de texto chata de um PDF.

Alimentar ferramentas de análise

Prepare documentos para índices de busca, contagens de palavras ou scripts de análise de texto que esperam texto simples.

Ler com tecnologia assistiva

Abra o texto do documento em um aplicativo de leitura ou em um editor de letras grandes que lida melhor com texto simples do que com PDF.

Limitações importantes

PDF para TXT extrai só o texto que já existe, então digitalizações precisam de OCR antes. Layouts com várias colunas podem ficar fora de ordem, cabeçalhos e rodapés repetidos são incluídos, e toda a formatação, as tabelas e as imagens ficam de fora.

PDF para TXT: perguntas frequentes

Por que meu arquivo de texto está vazio?

O PDF não tem camada de texto, algo típico de digitalizações e fotos. Passe pelo OCR PDF e extraia de novo.

Por que o texto saiu embaralhado?

Alguns PDFs guardam os caracteres sem informação sobre quais letras eles representam. O OCR PDF recria o texto a partir da imagem da página, o que normalmente resolve.

A formatação é mantida?

Não. Um arquivo TXT guarda só caracteres simples, então negrito, fontes, tabelas e imagens ficam de fora.

Qual codificação é usada?

O arquivo é salvo em UTF-8, que todo editor moderno lê e que aceita todos os idiomas.

Saiba mais