O nastaliq e por que ele importa para o OCR
O nastaliq é um estilo fluido e caligráfico. Em vez de ficarem sobre uma linha reta, as letras de uma palavra descem inclinadas da direita para a esquerda, as letras ligadas se empilham e se sobrepõem, e os pontos se amontoam nos pequenos espaços entre elas. As palavras costumam ser formadas por vários grupos separados de letras ligadas, então os espaços dentro de uma palavra podem parecer os espaços entre palavras. Cada uma dessas características dificulta para um motor de OCR separar as letras, manter os pontos e decidir onde as palavras começam e terminam. Documentos impressos com uma fonte urdu no estilo naskh, usada em alguns formulários e documentos digitais, geralmente são reconhecidos melhor do que a impressão nastaliq tradicional. Vale saber qual estilo você tem antes de julgar os resultados.
Como funciona o OCR em urdu do VelloDoc
O OCR PDF usa o motor de código aberto Tesseract com seus dados do idioma urdu. Quando você escolhe urdu, cada página é desenhada a cerca de 250 DPI, as palavras são reconhecidas e o texto reconhecido é colocado de forma invisível sobre a página original, então a página parece a mesma, mas pode ser pesquisada e copiada. Neste guia, a ferramenta acima já começa com o urdu selecionado. Escolha urdu, e não árabe, para documentos em urdu: o urdu usa letras que o árabe não tem, como ٹ, ڈ, ڑ, ں e ے, e os dados do urdu são baseados em palavras em urdu. Se um documento em urdu tiver palavras em inglês, adicione inglês como segundo idioma para que as duas escritas sejam reconhecidas.
Preparando digitalizações em urdu
Os detalhes pequenos e apertados do nastaliq são a primeira coisa que uma digitalização ruim destrói, então dê ao motor toda a nitidez possível. Digitalize páginas impressas a 300 DPI ou mais em tons de cinza, mantenha as páginas planas para que as linhas não se curvem perto da lombada e limpe o vidro do scanner. Com o celular, fotografe cada página bem de frente, com luz uniforme, preencha o quadro com o papel e evite sombras. Não comprima as digitalizações antes do reconhecimento: uma compressão JPEG forte borra os pontos e as ligações que diferenciam as letras. Rode o OCR na melhor versão que você tiver e comprima o arquivo final depois, se ele precisar ficar menor.
Uma ordem confiável de etapas
Para uma pilha de páginas digitalizadas, uma boa sequência é: junte as fotos do celular em um único arquivo com Digitalizar para PDF, ou comece pelo PDF do seu scanner; tire os versos vazios de digitalizações frente e verso com Remover páginas em branco; endireite as páginas tortas com Endireitar PDF; e então rode o OCR. Mantenha essa ordem, porque linhas retas de escrita urdu são reconhecidas com muito mais confiabilidade do que linhas inclinadas. Por fim, confira o resultado e, se necessário, reduza o tamanho com Comprimir PDF.
Conferindo e editando o texto em urdu reconhecido
Pesquise no resultado algumas palavras que você vê na página. Conte com algumas buscas falhando mesmo quando a palavra está lá, porque uma única letra lida errado já quebra a correspondência. Confira com cuidado nomes, números e datas; documentos em urdu podem usar algarismos arábico-índicos orientais, e o reconhecimento deles pode variar. Para editar o texto, PDF para Word o recupera como documento editável e PDF para TXT o salva como texto simples. Abra qualquer um dos dois em um programa com suporte a texto em urdu da direita para a esquerda e reserve tempo para as correções. Cada leitor lida de um jeito com texto da direita para a esquerda em camadas invisíveis, então, se o texto copiado aparecer fora de ordem, teste outro aplicativo.
Quando o OCR não é a resposta
O OCR de uso geral não foi feito para letra de mão, caligrafia decorativa, cópias em papel-carbono apagadas ou páginas muito danificadas, e a poesia em urdu composta em estilos ornamentados é especialmente difícil. Com materiais assim, a camada pesquisável ainda pode ajudar a encontrar a página certa, mas o texto em si não é confiável. Se a precisão for crítica, por exemplo em citações jurídicas ou acadêmicas, compare os trechos reconhecidos com a imagem da página ou digite-os de novo. O guia sobre PDFs pesquisáveis explica as camadas de texto, e o guia de OCR em árabe trata dos desafios parecidos da impressão em árabe.
Perguntas
Escolho urdu ou árabe para texto em urdu?
Escolha urdu. O urdu usa letras que o árabe não tem, e os dados do idioma urdu são baseados em palavras em urdu.
Por que há tantos erros no meu texto em urdu reconhecido?
A impressão nastaliq é difícil para os motores de OCR, e letras pequenas, baixa resolução, inclinação e ruído acrescentam erros. Digitalize de novo a 300 DPI ou mais, endireite as páginas com Endireitar PDF e confira o resultado com cuidado.
Posso editar o texto em urdu depois do OCR?
Sim. Extraia-o com PDF para Word ou PDF para TXT e edite-o em um programa com suporte a texto da direita para a esquerda. Conte com corrigir alguns erros de reconhecimento.
O OCR funciona com urdu escrito à mão?
Em geral, não. Os dados do idioma foram feitos para texto impresso, então a letra de mão gera resultados pouco confiáveis.
Meu documento fica guardado depois do OCR?
Não. O arquivo é processado em uma pasta de tarefa temporária e excluído depois que o resultado é entregue. A página de segurança dos arquivos explica os detalhes.