How to extract Arabic text from a scanned PDF
Um documento árabe escaneado é uma imagem: não dá para copiar nem pesquisar o texto. O reconhecimento óptico de caracteres resolve isso, no seu próprio aparelho.
Por que isso acontece
Um escaneamento é uma foto da página. O que você vê são pixels, não letras. O OCR lê as formas e as transforma de volta em texto.
Passo a passo
- Abra a ferramenta OCR.
- Adicione o arquivo escaneado ou a foto.
- Escolha árabe como idioma.
- Execute e baixe o texto.
Vale saber
A precisão depende do escaneamento: reto, bem iluminado e a 300 dpi funciona bem; uma foto torta de um fax apagado, não. Revise sempre nomes e números.