O que o OCR faz e quando você precisa dele
Existem dois tipos de PDF que parecem iguais na tela. O digital guarda o texto como texto — você seleciona uma palavra com o mouse e ela é selecionada. O digitalizado guarda apenas fotos do papel: não há uma única letra ali, só pixels formando o desenho das letras.
No segundo caso, copiar é impossível — não há o que copiar. É aí que entra o OCR, sigla para reconhecimento óptico de caracteres: ele olha a imagem e identifica quais letras estão desenhadas, produzindo texto de verdade a partir da figura.
O teste que define qual é o seu caso leva dois segundos: abra o PDF e tente selecionar uma palavra. Se conseguir, use a ferramenta Extrair Texto de PDF, que é instantânea e exata. Se só der para arrastar um retângulo por cima, é digitalização, e o OCR é o caminho.
Escolher o idioma certo muda o resultado
São seis idiomas disponíveis: português, inglês, espanhol, francês, alemão e italiano. E essa escolha importa muito mais do que parece.
O reconhecimento não olha letra por letra isoladamente — ele usa o conhecimento do idioma para decidir entre alternativas parecidas. Sabendo que o texto é português, o sistema espera acentos, cedilha e combinações como 'ção' e 'nh'. Um documento em português processado como inglês perde todos os acentos e erra muito mais.
Na primeira execução de cada idioma, o navegador baixa os dados de reconhecimento correspondentes. Por isso a primeira vez demora mais.
Conte com erros e revise
OCR erra, e planejar isso é parte de usar a ferramenta. A precisão depende diretamente da qualidade da digitalização: documento nítido, reto e bem iluminado sai quase perfeito; foto tirada torta com o celular, tinta fraca, papel amassado ou fundo escuro produzem erros.
As confusões clássicas são sempre as mesmas: 0 com O, 1 com l, rn lido como m. Em texto corrido isso é fácil de corrigir na leitura. Em números, não — um CPF, um valor ou uma data lidos errado passam despercebidos e causam problema real.
Por isso a regra: use o OCR para não redigitar, mas sempre revise, conferindo com atenção especial qualquer número. E se o documento for digitalizado por você, vale caprichar na origem — página reta, boa iluminação e resolução alta melhoram o resultado mais do que qualquer ajuste depois.
Limitações
- Até 20 páginas por execução. Para documentos maiores, separe em blocos com Extrair Páginas de PDF.
- Demora. O reconhecimento roda no seu aparelho, página por página.
- Não gera PDF pesquisável. Devolve o texto para copiar ou baixar, não um novo documento com camada de texto.
- Não funciona com letra de mão. Foi feito para texto impresso.
- Perde a formatação. Sai texto puro, sem negrito, colunas ou tabelas estruturadas.
- Seis idiomas — escolher o errado degrada bastante o resultado.
