FerramentasTodas as ferramentas

PDF

Reconhecer texto em imagem e PDF escaneado (OCR)

Reconhece o texto de uma imagem ou de um PDF escaneado, página por página, em português ou inglês, com progresso e opção de cancelar — o resultado sai como texto simples e também na mesma estrutura usada para gerar .docx ou .xlsx diretamente, sem precisar de um PDF com texto real.

Arraste uma ou várias imagens/PDFs aqui, ou clique para escolher

Imagem (JPG, PNG, WebP) ou PDF, até 50 MB cada

Na primeira vez que usar esta ferramenta neste navegador (ou ao trocar de idioma), cerca de 5.2 MB são baixados — o motor de reconhecimento (~3.8 MB, compartilhado por qualquer idioma) e o dado do idioma escolhido (~1.3 MB, só Português). Fica em cache no navegador para os próximos usos.

Quer mais controle sobre a conversão do texto reconhecido? Use PDF para Word ou PDF para Excel — os botões acima já aplicam a mesma conversão diretamente sobre o texto reconhecido aqui, sem precisar gerar um PDF intermediário.

Processamento local: seu arquivo não sai do seu computador.

  • Faz:Reconhece o texto de uma imagem ou de um PDF escaneado, página por página, em português ou inglês, com progresso e opção de cancelar — o resultado sai como texto simples e também na mesma estrutura usada para gerar .docx ou .xlsx diretamente, sem precisar de um PDF com texto real.
  • Processa:O PDF é processado inteiramente no seu navegador — nada é enviado a servidor.
  • Primeira vez:Baixa um arquivo grande (modelo ou motor) do próprio servidor do site no primeiro uso — o arquivo que você processa continua sem sair do navegador. Ver "Como funciona" na home.

Quando o texto não é texto de verdade

Um PDF gerado direto de um editor de texto guarda cada letra como texto de verdade, pronto para copiar ou extrair diretamente. Um PDF escaneado — a digitalização de um papel — ou uma foto de um documento não têm essa camada: o que existe é só uma imagem, e o que parece texto é, para o computador, um conjunto de pixels como qualquer outra parte da foto. OCR (reconhecimento óptico de caracteres) é o processo de identificar, a partir desses pixels, quais letras e palavras provavelmente estão ali — é isso que esta ferramenta faz, usando o motor de código aberto Tesseract, rodando inteiramente no navegador.

Por que o navegador baixa arquivo grande na primeira vez

O motor de reconhecimento e o conjunto de dados treinados de cada idioma são arquivos grandes — o motor sozinho passa de 3 MB, e o dado de cada idioma soma mais alguns megabytes, específico daquele idioma. Carregar tudo isso junto com a página deixaria qualquer ferramenta deste portal lenta para todo mundo, mesmo quem nunca usa OCR. Por isso o download só acontece quando a ferramenta é de fato usada, com o tamanho real mostrado antes de começar — e só do idioma escolhido, nunca de todos ao mesmo tempo.

Como o progresso por página funciona

Um PDF escaneado com várias páginas é processado uma página de cada vez: cada página vira uma imagem internamente (a mesma tecnologia usada para gerar miniatura de PDF neste portal), passa pelo reconhecimento, e só então a próxima página começa. O indicador de progresso mostra em qual página o processamento está — útil para saber quanto falta num documento longo, e para decidir se vale a pena cancelar caso o resultado das primeiras páginas já pareça ruim o suficiente para não valer a pena continuar.

O que determina um bom resultado

Precisão de OCR depende diretamente da qualidade da imagem de entrada: boa resolução, bom contraste entre o texto e o fundo, sem inclinação nem desfoque, produzem resultado bem mais confiável do que uma foto tirada de ângulo, com pouca luz, ou um scan de baixa qualidade. Texto manuscrito, em particular, não é reconhecido de forma confiável por este motor — ele foi treinado para texto impresso ou digitado, com formas de letra muito mais regulares do que a escrita à mão de qualquer pessoa.

A mesma estrutura, para as mesmas conversões

O texto reconhecido não sai só como texto solto — sai organizado na mesma estrutura usada pelas ferramentas PDF para Word e PDF para Excel deste portal: parágrafo, hierarquia de título estimada, e alinhamento de coluna candidato a tabela. Por isso, um botão próprio gera o .docx e outro detecta tabela e gera o .xlsx diretamente do resultado do OCR, sem precisar primeiro montar um PDF intermediário com esse texto para depois converter de novo.

Por que só português e inglês nesta primeira versão

Cada idioma precisa do próprio conjunto de dados treinados — não é uma opção de configuração, é um arquivo inteiro por idioma, específico da forma como aquele idioma é escrito. Oferecer muitos idiomas de uma vez significaria manter, hospedar e validar dezenas desses arquivos. Português e inglês cobrem a maior parte do uso esperado deste portal nesta primeira versão — mais idiomas podem ser adicionados depois, sem mudar como a ferramenta funciona para quem já usa.

Processando vários arquivos de uma vez

É possível enviar mais de uma imagem ou PDF ao mesmo tempo — cada arquivo é processado na fila, um de cada vez, com o mesmo idioma escolhido para todos. O progresso mostra tanto o arquivo atual da fila quanto a página atual dentro dele (quando é um PDF de várias páginas), e cancelar interrompe antes do próximo arquivo ou da próxima página começar — o que já foi reconhecido até ali não se perde.

O que esta ferramenta não faz

Ela não garante precisão perfeita — o resultado depende da qualidade da imagem de entrada, e deve sempre ser conferido antes de qualquer uso onde exatidão importa. Não reconhece texto manuscrito de forma confiável. Não identifica idioma automaticamente — o idioma precisa ser escolhido antes de começar, e escolher o idioma errado prejudica bastante a precisão. E não processa nenhum arquivo em servidor algum: todo o reconhecimento acontece no navegador, com os dados do idioma baixados de um bucket próprio, nunca enviados a terceiro.

Perguntas frequentes

Qual a diferença entre esta ferramenta e pdf-para-texto-limpo ou pdf-para-word?

As outras ferramentas de PDF deste portal leem o texto que já existe como texto dentro do arquivo — rápido e preciso, mas não funciona quando o PDF é uma imagem escaneada (sem nenhum texto real por trás). Esta ferramenta faz reconhecimento óptico de caracteres (OCR): identifica letra por letra a partir da imagem, funcionando tanto para PDF escaneado quanto para uma foto ou captura de tela comum — mas com precisão que depende da qualidade da imagem, ao contrário da leitura direta de texto real.

Por que a ferramenta baixa arquivo grande na primeira vez que uso?

O motor de reconhecimento e o dado específico do idioma escolhido são arquivos grandes demais para carregar junto com a página — por isso só são baixados quando você de fato usa a ferramenta, uma vez por navegador (ficam em cache depois). O aviso antes de começar mostra o tamanho real desse download, sem surpresa.

Por que só português e inglês nesta primeira versão?

Cada idioma exige seu próprio arquivo de dado treinado, então oferecer muitos idiomas de uma vez custaria manter e validar dezenas de arquivos grandes. Português e inglês cobrem a maior parte do uso esperado deste portal — mais idiomas podem ser adicionados depois, sem mudar como esta ferramenta funciona.

O reconhecimento funciona bem com qualquer imagem?

Não — a precisão depende diretamente da qualidade da imagem: boa resolução, bom contraste entre texto e fundo, sem inclinação nem desfoque, dão resultado bem mais confiável. Texto manuscrito não é reconhecido de forma confiável por este motor, pensado para texto impresso ou digitado. O resultado deve sempre ser conferido, nunca usado sem revisão em contexto onde precisão importa.

Posso gerar um .docx ou .xlsx direto do texto reconhecido?

Sim — depois do reconhecimento, botões próprios geram o .docx (reconstruindo parágrafo e título, como em PDF para Word) ou detectam tabela e geram o .xlsx (como em PDF para Excel), usando a mesma estrutura e as mesmas ferramentas de conversão deste portal, sem precisar gerar um PDF intermediário primeiro.

Ferramentas relacionadas