Por que o árabe é mais difícil para o OCR
O árabe é escrito da direita para a esquerda em uma escrita ligada, então a maioria das letras se une às vizinhas e assume uma forma diferente no início, no meio ou no fim da palavra, ou quando aparece sozinha. Várias letras compartilham a mesma forma básica e só se diferenciam pelo número e pela posição dos pontos, como ب, ت e ث, então um grão de poeira ou um ponto faltando pode mudar uma palavra. Muitos textos também omitem os sinais das vogais breves, enquanto textos religiosos, poéticos e educativos podem trazê-los por completo, com pequenos sinais acima e abaixo da linha. Números e palavras em alfabeto latino correm da esquerda para a direita dentro de frases escritas da direita para a esquerda. Um motor de OCR precisa separar as letras ligadas, manter cada ponto e cada sinal e colocar tudo de volta na ordem certa, e é por isso que a qualidade da digitalização importa ainda mais no árabe do que no inglês.
Como o VelloDoc reconhece texto em árabe
O OCR PDF usa o motor de código aberto Tesseract com seus dados do idioma árabe. Quando você escolhe árabe como idioma do OCR, cada página é desenhada a cerca de 250 DPI, o Tesseract encontra as palavras nela e o texto reconhecido é colocado de forma invisível sobre as palavras da página original. A página continua com a mesma aparência, mas agora dá para pesquisar, selecionar e copiar o texto. Neste guia, a ferramenta acima já começa com o árabe selecionado. Em um documento que mistura árabe e inglês, escolha árabe e adicione inglês como segundo idioma para que os dois sejam reconhecidos. Páginas que já têm texto selecionável ficam como estão, então em um arquivo misto só as páginas digitalizadas são lidas.
Digitalizando documentos em árabe para um reconhecimento melhor
Comece pela página mais nítida e lisa que você conseguir. No scanner, 300 DPI em tons de cinza é uma boa configuração padrão para árabe impresso; letras muito pequenas ou texto com todos os sinais de vogais podem se beneficiar de uma resolução maior, desde que o resultado continue nítido. Mesmo que as páginas sejam desenhadas de novo a cerca de 250 DPI para o reconhecimento, uma origem limpa continua importando, porque borrões, ruído e sombras são levados junto. Com o celular, preencha o quadro com a página, mantenha a câmera paralela ao papel e use luz uniforme, sem sombras sobre o texto. Digitalizar para PDF junta fotos do celular em um único PDF, mas não detecta as bordas da página nem corrige a perspectiva, então corte e endireite as fotos antes. O guia para digitalizar melhor com o celular detalha iluminação e enquadramento.
Endireite as páginas antes de rodar o OCR
Linhas inclinadas confundem o reconhecimento, e as letras árabes ligadas são especialmente sensíveis, porque o motor segue a linha em que elas se apoiam. Endireitar PDF detecta o ângulo de cada página e a endireita automaticamente. A ordem importa: o Tesseract lê linhas retas com muito mais confiabilidade do que linhas inclinadas. Endireite primeiro e depois rode o OCR no arquivo endireitado. Se o documento tiver versos em branco de uma digitalização frente e verso, remova-os antes do reconhecimento com Remover páginas em branco, o que economiza tempo e evita páginas vazias no resultado.
Conferindo e reaproveitando o texto reconhecido
Abra o resultado e pesquise algumas palavras que você vê na página, como um nome ou um lugar. Se a busca as encontrar, a camada de texto está funcionando. Depois confira os detalhes que mais importam, porque os erros de OCR raramente são óbvios: letras parecidas que só se diferenciam pelos pontos, letras finais como ة e ه ou ي e ى, datas e números. Cada leitor de PDF lida de um jeito com texto da direita para a esquerda em uma camada invisível, então o texto copiado pode aparecer fora de ordem em alguns aplicativos; testar outro leitor costuma ajudar. Para trabalhar com o texto em si, PDF para TXT o salva como arquivo de texto simples, que você pode abrir em qualquer editor com suporte ao árabe, e PDF para Word o recupera como documento editável, sem o layout original.
Documentos com os quais o OCR vai ter dificuldade
Alguns materiais simplesmente vão além do que um OCR de uso geral consegue ler com confiança. Letra de mão, caligrafia decorativa, impressos muito antigos ou danificados e fotocópias apagadas costumam gerar muitos erros ou nenhum texto. Carimbos e assinaturas sobre o texto escondem letras, tabelas e layouts com várias colunas podem ser lidos na ordem errada, e textos totalmente vocalizados podem perder ou deslocar os sinais. Com documentos assim, a camada pesquisável ainda pode ajudar a encontrar a página certa, mas os trechos importantes devem ser conferidos com a imagem ou digitados de novo. O guia sobre PDFs pesquisáveis explica as camadas de texto e quando o OCR é a ferramenta certa.
Perguntas
O VelloDoc consegue ler árabe escrito à mão?
Não de forma confiável. Os dados do idioma árabe foram feitos para texto impresso, então a letra de mão costuma gerar muitos erros ou nenhum texto.
Por que o texto em árabe copiado aparece invertido ou quebrado?
Os leitores de PDF lidam de formas diferentes com texto da direita para a esquerda em camadas de texto invisíveis. Teste outro leitor, ou extraia o texto com PDF para TXT e abra-o em um editor com suporte ao árabe.
Escolho árabe ou inglês para um documento misto?
Escolha árabe e adicione inglês como segundo idioma. Os dois são usados juntos, e as palavras em inglês do documento são lidas com muito mais confiabilidade.
O OCR muda a aparência das minhas páginas?
Não. As páginas mantêm a própria imagem, e o texto reconhecido é adicionado por cima como uma camada invisível. Páginas que já têm texto selecionável ficam como estão.
Em que resolução devo digitalizar?
300 DPI é uma boa configuração padrão para árabe impresso. Letras muito pequenas ou texto com todos os sinais de vogais podem se beneficiar de uma resolução maior, desde que a digitalização continue nítida.