Um PDF digitalizado parece um documento, mas se comporta como uma fotografia: não dá para pesquisar, copiar uma frase ou pedir a um leitor de tela que o leia em voz alta. O reconhecimento óptico de caracteres resolve isso. O OCR PDF lê as palavras de cada página e as coloca sobre ela como texto invisível, então a página fica exatamente igual, mas pode ser pesquisada, selecionada e indexada. Ele lê 39 idiomas, dois de cada vez em documentos que os misturam, e também pode entregar o texto em um arquivo separado.
Como usar: OCR PDF
- Adicione o PDF digitalizado. Endireite antes as páginas tortas com Endireitar PDF para melhorar a precisão.
- Escolha o idioma do documento e um segundo idioma se as páginas misturarem dois.
- Escolha PDF pesquisável ou arquivo de texto e selecione Executar OCR.
- Baixe o resultado e teste pesquisando uma palavra que você vê em uma página.
Como a camada pesquisável é criada
Cada página é desenhada a 250 DPI e o motor Tesseract encontra as palavras nesse desenho. Depois, as palavras são colocadas sobre a página original como texto invisível, nas mesmas posições das palavras que você vê. A digitalização mantém a própria resolução, e o texto real, os desenhos ou os links da página continuam como estavam: só a camada invisível é adicionada. Páginas que já têm texto, digitado ou de um OCR anterior, ficam como estão, então rodar o OCR duas vezes não duplica o texto.
Escolher o idioma certo
O OCR reconhece os caracteres com o modelo de um idioma específico, então acertar o idioma do documento importa mais do que qualquer outra configuração. A lista tem 39 idiomas, entre eles árabe, chinês simplificado e tradicional, grego, hebraico, hindi, japonês, coreano, russo, tailandês, turco, ucraniano, urdu e vietnamita, além dos principais idiomas europeus. Em documentos que misturam idiomas, como um contrato em francês com um anexo em inglês, escolha um segundo idioma e os dois modelos são usados juntos. Com o modelo errado, uma carta em francês lida como inglês perde os acentos e troca palavras. Para digitalizações em escrita árabe, os guias de OCR em árabe e de OCR em urdu explicam como preparar a digitalização e que precisão esperar.
Resultados precisos
O reconhecimento é tão bom quanto a digitalização. Páginas retas, com luz uniforme e bom contraste funcionam melhor, e o Endireitar PDF ajuda quando estão inclinadas. Letra pequena, letra de mão, carimbos sobre o texto e layouts em várias colunas são onde os erros aparecem, então confira nomes, números e datas. Escolha Arquivo de texto para receber as palavras reconhecidas em um .txt, página após página, ou continue com PDF para Word para ter um documento editável. O guia sobre PDFs pesquisáveis explica as camadas de texto em detalhes.
Quando usar: OCR PDF
Arquivos de documentos pesquisáveis
Encontre por palavra-chave anos de cartas e extratos digitalizados em vez de abrir os arquivos um por um.
Copiar texto de uma digitalização
Selecione e copie um parágrafo, um endereço ou um número de referência de uma página digitalizada em vez de digitá-lo de novo.
Legível por leitores de tela
Uma camada de texto permite que leitores de tela leiam páginas digitalizadas em voz alta, o primeiro passo para um documento acessível.
Limitações importantes
O OCR PDF reconhece texto impresso em 39 idiomas, até dois por tarefa, e precisa do Tesseract com os dados do idioma no servidor. Páginas que já contêm texto ficam como estão. Conte com erros em letra pequena, letra de mão e layouts complexos, e confira nomes, números e datas.
OCR PDF: perguntas frequentes
Como sei se meu PDF precisa de OCR?
Tente selecionar uma palavra com o cursor ou pesquise uma palavra que você vê. Se nada for encontrado, ou se você só conseguir desenhar um retângulo sobre a página, o texto faz parte de uma imagem e o OCR vai ajudar.
O OCR muda a aparência do documento?
Não. Cada página é mantida como estava, com a mesma qualidade de imagem, e as palavras reconhecidas são adicionadas por cima como texto invisível.
O OCR consegue ler letra de mão?
O Tesseract foi feito para texto impresso. Letras de forma bem desenhadas às vezes são reconhecidas, mas letra cursiva normalmente não, então não confie no OCR para anotações à mão.
Posso receber só o texto?
Sim. Escolha Arquivo de texto como resultado e as palavras reconhecidas chegam em um arquivo .txt, página por página. Páginas que já tinham texto contribuem com esse texto como está.
Por que o OCR diz que um idioma não está instalado?
Cada idioma precisa dos dados do Tesseract no servidor. Se estiverem faltando, o VelloDoc avisa em vez de devolver um arquivo sem camada de texto.