OCR de PDF
Reconheça o texto de um PDF escaneado e receba um arquivo que dá para buscar e copiar.
O reconhecimento roda no seu dispositivo, então registros e arquivos escaneados ficam com você. Só os dados de idioma são buscados, uma vez, e o navegador os guarda em cache.
Converta o resultado pesquisável para Word
Sobre OCR de PDF
Um PDF escaneado é uma fotografia de um documento. Você consegue ler, mas nada mais consegue: a busca não acha nada, copiar não dá nada e qualquer ferramenta que trabalhe com texto fica sem matéria-prima. O reconhecimento de texto resolve isso lendo as formas das letras e gravando o que encontra dentro do arquivo como uma camada invisível posicionada exatamente sobre as palavras impressas. A página continua idêntica — o escaneamento não é tocado —, mas o documento agora é pesquisável, selecionável e conversível. O reconhecimento roda no seu navegador, em qualquer um de doze idiomas.
Recursos
- O reconhecimento roda no seu navegador: as páginas nunca são enviadas
- Doze idiomas, incluindo híndi, russo, chinês, japonês e árabe
- A camada de texto invisível fica sobre o escaneamento original, que permanece intacto
- Duas qualidades de digitalização, trocando velocidade por precisão em letra pequena
- Saída em texto simples além do PDF pesquisável
- Progresso por página, com um controle para parar documentos longos
- Os dados de idioma são baixados uma vez e ficam em cache no navegador
Como usar OCR de PDF
- Solte o PDF escaneado na página
- Escolha o idioma impresso na página e uma qualidade de digitalização
- Inicie o reconhecimento e acompanhe o avanço pelas páginas
- Baixe o PDF pesquisável, ou só o texto reconhecido
Exemplo
Entrada
1987-minutes.pdf — 8 scanned pages, typewritten English
Saída
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
A página visível não muda; o que muda é que as palavras agora estão dentro do arquivo.
Erros comuns e solução de problemas
- O texto reconhecido está cheio de erros. — O reconhecimento depende do escaneamento. Tente a qualidade maior e confira se o idioma bate com a página: dados de inglês numa página em alemão produzem exatamente isso.
- O reconhecimento está muito lento. — É um trabalho genuinamente pesado, e acontece no seu próprio processador e não num servidor. Use a qualidade rápida e divida documentos longos.
- Um documento com dois idiomas reconhece mal. — Um idioma é usado por execução. Divida o documento por idioma, reconheça cada parte e junte os resultados.
- A escrita à mão não foi reconhecida. — Isto reconhece texto impresso e datilografado. Escrita à mão exige uma classe de modelo completamente diferente.
Perguntas frequentes
- O texto reconhecido substitui o escaneamento?
- Não. A imagem continua exatamente como estava e o texto é acrescentado atrás, invisível. É isso que faz um PDF pesquisável parecer idêntico ao original.
- Minhas páginas escaneadas são enviadas para o reconhecimento?
- Não. O mecanismo de reconhecimento roda no seu navegador. A única coisa buscada são os dados de idioma, uma vez, e o navegador guarda em cache.
- Quantas páginas posso reconhecer de uma vez?
- Até trinta por execução, porque o reconhecimento é lento o bastante para que documentos longos sejam melhor tratados em lotes.
- Que qualidade devo escolher?
- Comece pela rápida. Passe para a maior quando a letra for pequena, o escaneamento for antigo, ou a primeira tentativa sair bagunçada.
- Posso rodar OCR num PDF que já tem texto?
- Pode, mas não faz sentido: confira antes tentando selecionar uma palavra. Se já houver texto, converta direto.
Ferramentas relacionadas
- PDF para texto — Extraia texto selecionável de um PDF como texto puro ou Markdown.
- Digitalizar para PDF — Use a câmera como scanner e salve as páginas em PDF.
- PDF para Word — Reconstrói um PDF como documento .docx editável.
- PDF para Excel — Extrai as tabelas de um PDF para uma pasta .xlsx ou CSV.
- PDF para HTML — Converte um PDF em HTML limpo e pesquisável.
- Comprimir PDF — Reduza um PDF rerenderizando cada página em JPEG com a qualidade e a resolução escolhidas.
- Resumidor de PDF — Resume um PDF longo por seções, no seu dispositivo.
Todas as ferramentas de ArrayKit