OCR de PDF
Transforme um PDF digitalizado em um PDF pesquisável e selecionável. O OCR roda localmente no seu navegador, então o arquivo nunca sai do seu dispositivo.
Nada é enviado
O mecanismo de OCR roda como WebAssembly dentro do seu navegador. Sua digitalização nunca vai para um servidor.
Veja o que foi lido
Cada palavra reconhecida é destacada na página, para você conferir o resultado antes de baixar.
11 idiomas
Suporta alfabeto latino, cirílico e escritas CJK, incluindo chinês, japonês, coreano e russo.
Grátis, sem cadastro
Sem conta, sem marca d’água e sem limite de páginas. O único limite real é a memória do seu aparelho.
Resumindo: O OCR de PDF lê o texto de uma página digitalizada e o grava de volta no PDF como uma camada de texto invisível. A página continua idêntica, mas você finalmente consegue pesquisar, selecionar e copiar. Esta ferramenta faz tudo isso dentro do seu navegador.
Por que PDFs digitalizados travam o seu trabalho
Um cliente devolve um contrato. Você precisa achar uma cláusula. Aperta Ctrl+F, digita a palavra, e o PDF diz que não há resultados — mesmo com a palavra ali na sua frente.
É nesse momento que a maioria vai atrás de OCR para PDF. O documento não está com defeito: ele simplesmente nunca teve texto.
Uma digitalização é uma imagem, não um documento
Quando um scanner ou a câmera do celular captura uma página, ele registra pixels. As letras que você vê são formas, não caracteres. Para o leitor de PDF, a página inteira é uma única imagem achatada.
O que você perde sem reconhecimento de texto
Sem busca. Sem copiar e colar. Sem seleção de texto para citar. Leitores de tela não anunciam nada. Seu sistema de gestão documental indexa um arquivo vazio. Todos esses recursos dependem de a página conter caracteres reais.
Onde dói mais
Contratos assinados, notas fiscais em papel, recibos, prontuários, artigos acadêmicos, arquivos antigos. São justamente os documentos que você mais vai precisar pesquisar depois, e justamente os que chegam digitalizados.
O que é OCR de PDF?
OCR de PDF é o processo de ler o texto da imagem de uma página digitalizada e gravá-lo de volta no PDF como uma camada de texto real, porém invisível — a página continua idêntica, mas agora você pode pesquisar, selecionar e copiar as palavras nela.
OCR significa reconhecimento óptico de caracteres. O mecanismo observa as formas na página, compara com as letras de um idioma e devolve caracteres mais a posição exata de cada palavra.
Como funciona a camada de texto invisível
As palavras reconhecidas são desenhadas de volta na página no modo de renderização de texto 3 do PDF, que significa “desenhe este texto, mas não o exiba”. Cada palavra fica exatamente sobre a sua imagem na digitalização.
É por isso que um arquivo com OCR bem feito parece intacto e, ainda assim, destaca corretamente na busca. Você está selecionando a camada invisível, não a imagem.
PDF pesquisável x extração de texto puro
Quando você quer um PDF pesquisável
Você precisa manter a aparência original: assinaturas, carimbos, papel timbrado, diagramação. Tudo que precise continuar apresentável ou juridicamente reconhecível deve continuar sendo PDF.
Quando você só quer o texto
Você vai colar em um e-mail, uma planilha ou uma nota. Então pule o PDF e leve a exportação em texto puro. Esta ferramenta entrega as duas coisas na mesma passada.
O que o OCR não resolve
O OCR lê o que está ali. Ele não recupera texto que a digitalização borrou e não faz revisão. Uma foto torta e de baixa resolução vai gerar resultados tortos e de baixa qualidade.
Como fazer OCR em um PDF em 3 passos
Todo o processo acontece na sua própria máquina. Sem fila, sem upload e sem sala de espera.
- 1
Abra o PDF digitalizado
Arraste o arquivo para a caixa acima ou escolha do seu dispositivo. Ele carrega direto na aba do navegador — não existe etapa de upload.
- 2
Escolha o idioma do documento
Escolha o idioma impresso na página, não o da sua interface. O mecanismo baixa esse pacote de idioma uma vez e o mantém em cache.
- 3
Rode o OCR e baixe
Acompanhe página a página, confira as palavras destacadas e leve o PDF pesquisável ou o texto puro. Os dois são gerados localmente.
Dica — O idioma pesa mais do que a maioria imagina. Rodar inglês sobre uma página em alemão destrói cada trema. Se o resultado parecer sem sentido, o idioma costuma ser o motivo.
Observação — A primeira passada em um idioma novo baixa um pacote de menos de 3 MB. Depois disso é instantâneo e funciona offline.
Veja o que o OCR realmente leu
A maioria das ferramentas de OCR entrega um arquivo e deseja boa sorte. Você só descobre se deu certo depois de baixar, abrir o PDF e pesquisar por conta própria.
É um mau negócio, porque a qualidade das digitalizações varia muito e o OCR falha em silêncio. Uma ferramenta que devolve 60 % de acerto parece exatamente igual a uma que devolve 99 %.
A camada de texto, visível
Ative “Mostrar camada de texto” e cada palavra reconhecida aparece demarcada na página. O que você vê é exatamente o que foi gravado no PDF.
Como identificar uma digitalização ruim antes de baixar
As palavras sobre as quais o mecanismo tem dúvida ficam marcadas em vermelho. Passe o mouse em qualquer caixa para ver o que ele leu e com quanta confiança.
Uma página com algumas caixas vermelhas espalhadas está normal. Uma página quase toda vermelha indica que algo está errado — em geral o idioma errado, ou uma digitalização que precisa ser refeita em resolução maior.
O que dá para fazer com um PDF pesquisável
Assim que a camada de texto existe, o documento passa a se comportar como um documento de verdade em todo lugar onde você o usar.
Pesquisar dentro do documento
Ctrl+F funciona em qualquer leitor de PDF, em qualquer aparelho. Achar uma cláusula num contrato digitalizado de 60 páginas deixa de ser rolagem manual.
Copiar e citar sem redigitar
Selecione um parágrafo e cole em um e-mail ou relatório. Sem transcrição e sem erros de digitação introduzidos no caminho.
Tornar digitalizações acessíveis
Leitores de tela só conseguem ler uma camada de texto. Rodar OCR costuma ser a maior melhoria de acessibilidade possível em um acervo de digitalizações.
Alimentar outras ferramentas com texto limpo
Índices de busca, apps de notas, tradutores e planilhas precisam de caracteres, não de pixels. A exportação em texto puro entra direto neles.
Sua digitalização nunca sai desta aba
Documentos digitalizados costumam ser os arquivos mais sensíveis que alguém tem: acordos assinados, passaportes, papelada de imposto, laudos médicos. Enviar isso para um servidor desconhecido só para poder pesquisar é uma troca estranha.
Esta ferramenta carrega o mecanismo de OCR no seu navegador como WebAssembly e o executa ali. Os pacotes de idioma vêm do nosso servidor, mas o seu documento não vai a lugar nenhum. Você pode desconectar da rede depois que a página carregar e ele ainda assim termina o trabalho.
OCR de PDF no navegador x ferramentas que exigem upload
Processar localmente é o padrão correto para documentos privados, mas não é isento de trocas. Esta é a comparação honesta.
| Aspecto | Esta ferramenta (no navegador) | Ferramentas de OCR com upload |
|---|---|---|
| Para onde vai o arquivo | Nunca sai do seu dispositivo | Enviado para um servidor remoto |
| Funciona offline | Sim, após o primeiro carregamento | Não |
| Limite de tamanho | Limitado pela memória do aparelho | Limitado pelo plano do serviço |
| Exige conta | Não | Muitas vezes, para arquivos maiores |
| Velocidade em PDFs enormes | Mais lenta — usa a sua CPU | Mais rápida — usa os servidores deles |
| Precisão em digitalizações difíceis | Boa em impressão limpa | Muitas vezes melhor — mecanismos comerciais |
As duas últimas linhas são reais. Um serviço comercial com mecanismo ajustado vai vencer um de código aberto diante de um fax amassado de 1998, e um parque de servidores sempre será mais rápido que um notebook em um arquivo de 500 páginas. Se o seu documento não é sensível e a precisão em uma digitalização ruim importa mais que privacidade, use um desses.
Como obter a melhor precisão de OCR
A qualidade do OCR é decidida, em boa parte, antes de você apertar o botão. Estes quatro pontos explicam quase toda a diferença.
- 1
Digitalize a 300 DPI ou mais
É o fator isolado mais importante. A 150 DPI as bordas dos caracteres começam a se fundir; a 72 DPI, a maioria dos mecanismos chuta. 300 DPI é o alvo padrão para reconhecimento de texto.
- 2
Endireite e limpe a página antes
Uma página torta em apenas dois graus já reduz a precisão de forma mensurável. Ative o endireitamento para digitalizações tortas e a remoção de fundo para as acinzentadas ou manchadas.
- 3
Um idioma por passada
Misturar pacotes de idioma dilui a precisão. Se o documento é majoritariamente em inglês com alguns nomes franceses, rode como inglês.
- 4
Confira a camada de texto e repita
Olhe as palavras destacadas antes de baixar. Se uma página estiver cheia de caixas vermelhas, troque o idioma ou os ajustes de digitalização e rode de novo — não custa nada.
Conjunto completo de ferramentas de PDF
Conheça nossa coleção completa de ferramentas de PDF, criadas para atender a todas as suas necessidades com documentos
PNG para PDF
Reúna imagens PNG em um único PDF pronto para impressão
JPG para PDF
Converta imagens JPG para o formato PDF
Juntar PDF
Combine vários arquivos PDF em um só
Comprimir PDF
Reduza o tamanho do PDF com eficiência
PDF para PNG
Converta páginas de PDF em imagens PNG
PDF para JPG
Converta páginas de PDF em imagens JPG
PDF para Texto
Extraia o conteúdo de texto de arquivos PDF
Dividir PDF
Divida o PDF em páginas separadas
Editar PDF
Edite e faça anotações em documentos PDF
Organizar PDF
Organize e reordene as páginas do PDF
Girar PDF
Gire as páginas do PDF e salve permanentemente
Números de página
Adicione números de página ao PDF com pré-visualização ao vivo
Marca d'água PDF
Adicione uma marca d'água de texto ao PDF com pré-visualização ao vivo
HEIC para JPG
Converta fotos HEIC do iPhone em JPG
Excluir Páginas de PDF
Remova páginas indesejadas e baixe um PDF limpo
Extrair Páginas de PDF
Salve as páginas selecionadas como um novo PDF ou arquivos separados
Assinar PDF
Desenhe, digite ou envie uma assinatura e posicione em qualquer página
Redimensionar PDF
Mude o tamanho da página para A4, Carta (Letter) ou dimensões personalizadas
Recortar PDF
Apare margens, selecione arrastando ou recorte o espaço em branco automaticamente
Achatar PDF
Torne formulários somente leitura — mantenha o texto pesquisável ou bloqueie como imagem
Metadados PDF
Veja, edite ou remova autor, título, datas e outros metadados
PDF em escala de cinza
Converta para escala de cinza ou preto e branco para economizar tinta colorida
Extrair imagens de PDF
Extraia as fotos embutidas de um PDF e salve como PNG ou JPG
WebP para PDF
Converta imagens WebP em PDF e junte várias em um único arquivo
Proteger PDF
Adicione uma senha de abertura ao seu PDF, totalmente no navegador
Desbloquear PDF
Remova uma senha conhecida ou restrições de um PDF, no navegador
HEIC para PDF
Converta fotos HEIC do iPhone em PDF
AVIF para PDF
Converta imagens AVIF em PDF
TIFF para PDF
Converta imagens e digitalizações TIFF em PDF
BMP para PDF
Converta imagens BMP em PDF
OCR PDF
Torne um PDF digitalizado pesquisável, tudo no seu navegador
Censurar PDF
Remova definitivamente o texto sensível de um PDF, no seu navegador
Comprimir imagem
Reduza JPEG, PNG e WebP em lote, tudo no seu navegador
Redimensionar imagem
Mude as dimensões em lote, com predefinições, no seu navegador
Perguntas frequentes
Tudo o que as pessoas perguntam antes de rodar OCR em uma digitalização.
Como fazer OCR em um PDF de graça?
Abra o arquivo acima, escolha o idioma do documento e clique em Rodar OCR. Todo o processo acontece nesta aba do navegador e não custa nada. Você recebe um PDF pesquisável e um arquivo de texto puro, sem conta e sem limite de páginas.
Esta ferramenta de OCR é realmente grátis? Qual é o limite?
É grátis, sem teto de páginas e sem marca d’água. Não impomos cota porque não arcamos com o custo — quem trabalha é o seu aparelho. O limite prático é a memória: digitalizações enormes em um celular antigo podem esgotá-la, e aí vale processar por intervalos de páginas.
Meus arquivos são enviados para um servidor?
Não. Seu PDF nunca sai do navegador. O mecanismo de OCR é WebAssembly rodando localmente. A única coisa baixada de nós é o mecanismo e o pacote de idioma. Dá para verificar desconectando da rede depois que a página carregar — o OCR continua funcionando.
Qual é a precisão do OCR?
Muito boa em texto impresso limpo, mais fraca em manuscritos e digitalizações ruins. Uma digitalização a 300 DPI de texto impresso comum costuma ser reconhecida acima dos noventa por cento. Escrita à mão, papel de fax desbotado, tabelas pesadas e fotos de baixa resolução pioram rápido. Use a visualização da camada de texto para julgar o seu documento em vez de confiar numa média.
Dá para converter um PDF digitalizado em Word com OCR?
Não diretamente — esta ferramenta gera um PDF pesquisável e texto puro, não um .docx. Na maioria dos casos, a exportação em texto puro é justamente o que você quer e pode ser colada direto num documento. Se você só precisa do texto isolado, nossa ferramenta de PDF para texto cobre esse caso.
Quais idiomas o OCR de PDF suporta?
Onze, cobrindo alfabeto latino, cirílico e escritas CJK. Inglês, chinês simplificado e tradicional, espanhol, português, alemão, francês, italiano, japonês, coreano e russo. Escritas não latinas recebem uma camada de texto completa, então digitalizações em chinês e russo ficam realmente pesquisáveis, não apenas em parte.
Por que a primeira passada é mais lenta que a segunda?
A primeira baixa o mecanismo de OCR e o pacote de idioma. Depois disso, os dois ficam em cache no navegador, então as passadas seguintes começam de imediato e funcionam sem conexão. Trocar para um idioma novo baixa aquele pacote uma vez.
O que fazer depois de rodar OCR em um PDF?
Normalmente comprimir ou extrair o texto. A camada de texto acrescenta só alguns kilobytes por página, mas a digitalização por baixo costuma ser grande. Comprimir depois mantém a busca e reduz o tamanho do arquivo.
Ferramentas relacionadas
Outras coisas que você pode querer fazer com o mesmo documento.
- PDF para texto — extraia o texto de um PDF que já tem camada de texto.
- Comprimir PDF — reduza a digitalização depois do OCR sem perder a camada de texto.
- PDF para PNG — exporte páginas como imagens se quiser tratá-las antes de digitalizar de novo.
- PDF em escala de cinza — tire a cor de uma digitalização ruidosa, o que costuma ajudar o reconhecimento.
- Juntar PDF — combine várias páginas digitalizadas em um documento antes de rodar o OCR.
- Censurar PDF — remova o texto sensível depois que a digitalização ficar pesquisável.
Torne suas digitalizações pesquisáveis
Rode OCR em um PDF aqui mesmo, no seu navegador. Sem upload, sem conta e sem limite de páginas.
Abrir a ferramenta de OCR