O que é OCR e como tornar um PDF escaneado pesquisável

O problema dos PDFs escaneados

Quando você digitaliza uma folha de papel, o scanner gera uma imagem. O PDF resultante parece um documento, mas por dentro é uma sequência de fotos. Por isso não é possível pesquisar uma palavra, copiar um trecho ou selecionar um parágrafo: para o computador, não há texto, apenas pixels.

O que é OCR

OCR significa reconhecimento óptico de caracteres. É a tecnologia que analisa a imagem de uma página, identifica as letras e gera o texto correspondente. Aplicado a um PDF escaneado, o OCR adiciona uma camada invisível de texto por trás da imagem: a aparência da página não muda, mas o texto passa a poder ser pesquisado, selecionado e copiado.

Como aplicar OCR em um PDF

Com a ferramenta PDF para OCR:

  1. Envie o PDF escaneado.
  2. Escolha o idioma do documento. A ferramenta reconhece português, inglês, espanhol, francês, alemão e italiano.
  3. Clique em processar e aguarde. Documentos longos podem levar alguns minutos.
  4. Baixe o PDF e teste: use a busca do leitor para procurar uma palavra do documento.

Se você só tem fotos, e não um PDF

Se os documentos estão como imagens (JPG, PNG, HEIC), use OCR para PDF, que junta as imagens em um único PDF, uma página por imagem, já com o texto reconhecido. E se ainda não digitalizou o documento, Scanner de PDF usa a câmera do celular ou do computador para fotografar as páginas e gerar o PDF, com opção de OCR.

Como conseguir um bom reconhecimento

A qualidade do OCR depende principalmente da qualidade da imagem:

O que fazer com o texto reconhecido

Com o PDF pesquisável, você pode localizar informações em segundos e copiar trechos para outros documentos. Se quiser editar o conteúdo, aplique PDF para Word depois do OCR. Nenhum OCR é infalível, então revise números, nomes e datas antes de usar o texto em algo importante.