Mascote Pingo

    OCR PDF

    Extraia texto de PDFs escaneados ou baseados em imagem usando OCR

    Ideal para PDFs escaneados ou baseados em imagem (máx. 50MB)

    O que é OCR?

    OCR (Reconhecimento Óptico de Caracteres) identifica e extrai texto de imagens e documentos escaneados. O processamento é feito localmente no seu navegador usando Tesseract.js - seus arquivos não são enviados para servidores externos.

    O que o OCR faz e quando você precisa dele

    Existem dois tipos de PDF que parecem iguais na tela. O digital guarda o texto como texto — você seleciona uma palavra com o mouse e ela é selecionada. O digitalizado guarda apenas fotos do papel: não há uma única letra ali, só pixels formando o desenho das letras.

    No segundo caso, copiar é impossível — não há o que copiar. É aí que entra o OCR, sigla para reconhecimento óptico de caracteres: ele olha a imagem e identifica quais letras estão desenhadas, produzindo texto de verdade a partir da figura.

    O teste que define qual é o seu caso leva dois segundos: abra o PDF e tente selecionar uma palavra. Se conseguir, use a ferramenta Extrair Texto de PDF, que é instantânea e exata. Se só der para arrastar um retângulo por cima, é digitalização, e o OCR é o caminho.

    Escolher o idioma certo muda o resultado

    São seis idiomas disponíveis: português, inglês, espanhol, francês, alemão e italiano. E essa escolha importa muito mais do que parece.

    O reconhecimento não olha letra por letra isoladamente — ele usa o conhecimento do idioma para decidir entre alternativas parecidas. Sabendo que o texto é português, o sistema espera acentos, cedilha e combinações como 'ção' e 'nh'. Um documento em português processado como inglês perde todos os acentos e erra muito mais.

    Na primeira execução de cada idioma, o navegador baixa os dados de reconhecimento correspondentes. Por isso a primeira vez demora mais.

    Conte com erros e revise

    OCR erra, e planejar isso é parte de usar a ferramenta. A precisão depende diretamente da qualidade da digitalização: documento nítido, reto e bem iluminado sai quase perfeito; foto tirada torta com o celular, tinta fraca, papel amassado ou fundo escuro produzem erros.

    As confusões clássicas são sempre as mesmas: 0 com O, 1 com l, rn lido como m. Em texto corrido isso é fácil de corrigir na leitura. Em números, não — um CPF, um valor ou uma data lidos errado passam despercebidos e causam problema real.

    Por isso a regra: use o OCR para não redigitar, mas sempre revise, conferindo com atenção especial qualquer número. E se o documento for digitalizado por você, vale caprichar na origem — página reta, boa iluminação e resolução alta melhoram o resultado mais do que qualquer ajuste depois.

    Limitações

    • Até 20 páginas por execução. Para documentos maiores, separe em blocos com Extrair Páginas de PDF.
    • Demora. O reconhecimento roda no seu aparelho, página por página.
    • Não gera PDF pesquisável. Devolve o texto para copiar ou baixar, não um novo documento com camada de texto.
    • Não funciona com letra de mão. Foi feito para texto impresso.
    • Perde a formatação. Sai texto puro, sem negrito, colunas ou tabelas estruturadas.
    • Seis idiomas — escolher o errado degrada bastante o resultado.

    Perguntas frequentes

    Quando eu preciso de OCR?

    Quando o PDF é uma digitalização e você não consegue selecionar o texto com o mouse. Nesse caso as páginas são fotos do papel: não existe texto ali para copiar, só pixels formando o desenho das letras. O OCR olha essa imagem e reconhece quais letras estão desenhadas, produzindo texto de verdade.

    Qual a diferença para a ferramenta Extrair Texto de PDF?

    Extrair Texto pega o texto que já existe no arquivo — é instantâneo e exato, mas só funciona em PDF digital. O OCR reconhece letras a partir da imagem, funciona em digitalização e é mais lento e sujeito a erro. Se o seu PDF permite selecionar o texto, use Extrair Texto: o resultado é perfeito. O OCR é para quando não há outra saída.

    O OCR erra?

    Erra, e é importante contar com isso. A precisão depende da qualidade da digitalização: documento nítido, reto e bem iluminado sai quase perfeito; foto tremida, tinta fraca, papel amassado ou manuscrito produzem erros. Confusões clássicas são 0 com O, 1 com l, rn lido como m. Sempre revise o resultado antes de usar, principalmente números — CPF, valor e data lidos errado causam problema real.

    Quais idiomas são reconhecidos?

    Seis: português, inglês, espanhol, francês, alemão e italiano. Escolher o idioma certo importa muito mais do que parece — ele orienta o reconhecimento e reduz erros, porque o sistema conhece as combinações de letras e os acentos daquela língua. Documento em português lido como inglês perde todos os acentos.

    Quantas páginas o OCR processa?

    Até 20 por execução. O limite existe porque cada página precisa ser renderizada e analisada, o que consome bastante processamento. Para documentos maiores, separe em blocos com a ferramenta Extrair Páginas de PDF e processe um de cada vez.

    Por que demora tanto?

    Porque o reconhecimento acontece no seu próprio aparelho, página por página, e é um processo pesado. Na primeira execução, o navegador ainda baixa os dados do idioma escolhido. Vinte páginas podem levar vários minutos — mantenha a aba aberta.

    Meu documento é enviado para algum servidor?

    Não. Todo o reconhecimento roda dentro da aba do seu navegador. O documento não sai do seu aparelho e não fica armazenado. Isso pesa bastante aqui: OCR costuma ser usado em documento digitalizado — contrato, laudo, certidão, papel com dado pessoal.

    O resultado é um PDF pesquisável?

    Não. A ferramenta devolve o texto reconhecido para você copiar ou baixar, não um novo PDF com camada de texto embutida. Se algum órgão exigiu 'PDF pesquisável', esse é um formato diferente e exige outra ferramenta.

    Funciona com letra de mão?

    Muito mal. O reconhecimento foi feito para texto impresso, e manuscrito tem variação demais. Não conte com isso.

    Preciso instalar algo ou criar conta?

    Não. Sem instalação, sem cadastro e sem limite diário.

    Ferramentas Relacionadas