Os arquivos nunca saem do seu dispositivo.Como funciona
Como aplicar OCR em um PDF
- 1Solte seu PDF digitalizado acima (ou clique para selecionar).
- 2Clique em Tornar pesquisável — cada página é reconhecida em sequência (o motor de OCR é baixado uma vez no primeiro uso).
- 3Baixe o PDF pesquisável.
Perguntas frequentes
- Meu arquivo é enviado para o OCR?
- Não. O reconhecimento roda inteiramente no seu navegador usando WebAssembly — seu PDF nunca sai do seu dispositivo. O motor de OCR e os dados de idioma são baixados uma vez de uma fonte pública (são software, não o seu arquivo) e depois ficam em cache.
- O que o OCR faz com o meu PDF?
- Ele lê o texto nas imagens da página e o adiciona de volta como uma camada invisível posicionada sobre as palavras. A página continua com a mesma aparência, mas agora você pode pesquisar, selecionar e copiar o texto em qualquer leitor de PDF.
- Quais idiomas são suportados?
- O inglês funciona melhor no momento. Outros sistemas de escrita, especialmente os não latinos como chinês, japonês ou árabe, ainda não são suportados.
- Por que é lento?
- OCR é um processamento pesado e roda localmente no seu dispositivo, e não em um servidor. Um documento longo ou em alta resolução pode demorar um pouco — é o preço de manter seu arquivo privado.
Transforme uma imagem de texto em texto de verdade
Um PDF escaneado, na prática, é apenas imagens — você consegue ver as palavras, mas não consegue pesquisar, selecionar ou copiá-las. O OCR (reconhecimento óptico de caracteres) lê essas imagens e adiciona o texto de volta como uma camada invisível posicionada exatamente sobre cada palavra. A página fica com a mesma aparência, mas agora é pesquisável em qualquer leitor. O HivePDF faz isso direto no seu navegador, então mesmo uma digitalização sensível nunca sai do seu dispositivo.
Privado, ainda que mais lento
A maioria das ferramentas de OCR envia seu documento a um servidor para fazer o trabalho pesado. O HivePDF, em vez disso, executa o reconhecimento localmente com WebAssembly. O mecanismo de OCR e seus dados do idioma inglês são baixados uma vez de uma fonte pública — isso é software, não o seu arquivo — e ficam em cache para a próxima vez. A contrapartida é a velocidade: uma digitalização longa ou de alta resolução leva um tempo, porque é o seu próprio dispositivo que está fazendo o trabalho.
Bom saber
O texto em inglês funciona melhor hoje; outras escritas ainda não são suportadas. O resultado é uma página raster mais uma camada de texto, então continua sendo uma cópia fiel da sua digitalização. Para reduzir o PDF pesquisável depois, use o Comprimir; para extrair as imagens das páginas, use o PDF para JPG.
Onde o OCR importa mais
Digitalizações antigas, contratos arquivados ou uma pilha de documentos fotografados com um celular são candidatos comuns — nada disso é pesquisável até que o OCR adicione uma camada de texto. Isso também importa para acessibilidade, já que leitores de tela precisam de texto de verdade, não de uma imagem de texto, para ler uma página em voz alta. Depois de processado, o arquivo se comporta como qualquer outro PDF pesquisável: você pode buscar uma cláusula, copiar um parágrafo ou indexá-lo em um arquivo de documentos.