VelloDoc
Otimizar PDF

OCR PDF

Adicione uma camada de texto pesquisável e selecionável a PDFs digitalizados com OCR em 39 idiomas. As páginas mantêm a aparência, e o texto também pode ser exportado.

Escolher arquivos

Solte os arquivos aqui ou clique para procurar


Aceita: PDFMáx. 80 MBExcluído após a entrega

Reconhece 39 idiomas, dois de cada vez. Confira o texto reconhecido antes de confiar nele.

Ferramentas relacionadas

Próximos passos comuns depois desta.

Um PDF digitalizado parece um documento, mas se comporta como uma fotografia: não dá para pesquisar, copiar uma frase ou pedir a um leitor de tela que o leia em voz alta. O reconhecimento óptico de caracteres resolve isso. O OCR PDF lê as palavras de cada página e as coloca sobre ela como texto invisível, então a página fica exatamente igual, mas pode ser pesquisada, selecionada e indexada. Ele lê 39 idiomas, dois de cada vez em documentos que os misturam, e também pode entregar o texto em um arquivo separado.

Como usar: OCR PDF

  1. Adicione o PDF digitalizado. Endireite antes as páginas tortas com Endireitar PDF para melhorar a precisão.
  2. Escolha o idioma do documento e um segundo idioma se as páginas misturarem dois.
  3. Escolha PDF pesquisável ou arquivo de texto e selecione Executar OCR.
  4. Baixe o resultado e teste pesquisando uma palavra que você vê em uma página.

Como a camada pesquisável é criada

Cada página é desenhada a 250 DPI e o motor Tesseract encontra as palavras nesse desenho. Depois, as palavras são colocadas sobre a página original como texto invisível, nas mesmas posições das palavras que você vê. A digitalização mantém a própria resolução, e o texto real, os desenhos ou os links da página continuam como estavam: só a camada invisível é adicionada. Páginas que já têm texto, digitado ou de um OCR anterior, ficam como estão, então rodar o OCR duas vezes não duplica o texto.

Escolher o idioma certo

O OCR reconhece os caracteres com o modelo de um idioma específico, então acertar o idioma do documento importa mais do que qualquer outra configuração. A lista tem 39 idiomas, entre eles árabe, chinês simplificado e tradicional, grego, hebraico, hindi, japonês, coreano, russo, tailandês, turco, ucraniano, urdu e vietnamita, além dos principais idiomas europeus. Em documentos que misturam idiomas, como um contrato em francês com um anexo em inglês, escolha um segundo idioma e os dois modelos são usados juntos. Com o modelo errado, uma carta em francês lida como inglês perde os acentos e troca palavras. Para digitalizações em escrita árabe, os guias de OCR em árabe e de OCR em urdu explicam como preparar a digitalização e que precisão esperar.

Resultados precisos

O reconhecimento é tão bom quanto a digitalização. Páginas retas, com luz uniforme e bom contraste funcionam melhor, e o Endireitar PDF ajuda quando estão inclinadas. Letra pequena, letra de mão, carimbos sobre o texto e layouts em várias colunas são onde os erros aparecem, então confira nomes, números e datas. Escolha Arquivo de texto para receber as palavras reconhecidas em um .txt, página após página, ou continue com PDF para Word para ter um documento editável. O guia sobre PDFs pesquisáveis explica as camadas de texto em detalhes.

Quando usar: OCR PDF

Arquivos de documentos pesquisáveis

Encontre por palavra-chave anos de cartas e extratos digitalizados em vez de abrir os arquivos um por um.

Copiar texto de uma digitalização

Selecione e copie um parágrafo, um endereço ou um número de referência de uma página digitalizada em vez de digitá-lo de novo.

Legível por leitores de tela

Uma camada de texto permite que leitores de tela leiam páginas digitalizadas em voz alta, o primeiro passo para um documento acessível.

Limitações importantes

O OCR PDF reconhece texto impresso em 39 idiomas, até dois por tarefa, e precisa do Tesseract com os dados do idioma no servidor. Páginas que já contêm texto ficam como estão. Conte com erros em letra pequena, letra de mão e layouts complexos, e confira nomes, números e datas.

OCR PDF: perguntas frequentes

Como sei se meu PDF precisa de OCR?

Tente selecionar uma palavra com o cursor ou pesquise uma palavra que você vê. Se nada for encontrado, ou se você só conseguir desenhar um retângulo sobre a página, o texto faz parte de uma imagem e o OCR vai ajudar.

O OCR muda a aparência do documento?

Não. Cada página é mantida como estava, com a mesma qualidade de imagem, e as palavras reconhecidas são adicionadas por cima como texto invisível.

O OCR consegue ler letra de mão?

O Tesseract foi feito para texto impresso. Letras de forma bem desenhadas às vezes são reconhecidas, mas letra cursiva normalmente não, então não confie no OCR para anotações à mão.

Posso receber só o texto?

Sim. Escolha Arquivo de texto como resultado e as palavras reconhecidas chegam em um arquivo .txt, página por página. Páginas que já tinham texto contribuem com esse texto como está.

Por que o OCR diz que um idioma não está instalado?

Cada idioma precisa dos dados do Tesseract no servidor. Se estiverem faltando, o VelloDoc avisa em vez de devolver um arquivo sem camada de texto.

Saiba mais