OCR de PDF online: leia texto de PDF digital (embutido) ou escaneado (OCR com Tesseract). Modo automático tenta texto nativo e só usa OCR nas páginas “imagem”. Tudo no navegador.
O PDF não sobe para o Dica. Extração e OCR são locais. Na primeira OCR o idioma é baixado da CDN do Tesseract (~10–20 MB) e fica em cache. 100% local no navegador
No celular: prefira PDFs com poucas páginas. OCR de várias páginas escaneadas pode demorar e usar muita memória.
PDF → Texto (OCR)
PDF digital vs escaneado
- Digital — o texto já está no arquivo; extração é rápida e fiel
- Escaneado — cada página é uma imagem; o OCR “lê” os pixels (pode errar em rascunhos ou fotos tortas)
O PDF sobe para o servidor?
Não. pdf.js e Tesseract rodam no navegador. Só a biblioteca de idioma do OCR vem da CDN na primeira vez.
Por que limitar páginas no OCR?
Renderizar + OCR é pesado na CPU e na memória. Para livros longos, processe em partes ou use o modo “só texto embutido” se o PDF for digital.
Qual a diferença para “PDF para texto”?
PDF para texto só lê texto embutido. Esta página adiciona OCR para scans.
Funciona no celular?
Sim, com PDFs curtos. Em aparelhos antigos, prefira poucas páginas e boa iluminação no scan original.












