Scanner de privacidade de PDF
Veja o que um PDF diz sobre você antes de enviá-lo: metadados, caminhos e dados pessoais.
O scanner de privacidade de PDF lê seu documento no seu dispositivo e mascara cada exemplo que relata. Nada do arquivo é enviado ou registrado.
Tarje o que está impresso na página
Sobre Scanner de privacidade de PDF
Todo PDF carrega mais do que a página mostra. O dicionário de propriedades costuma nomear um autor, registra qual aplicativo produziu o arquivo e quando, e às vezes preserva um caminho local completo com nome de usuário e estrutura de pastas. A camada de texto pode guardar bem mais: um e-mail num rodapé, um número de conta numa tabela, um número de cartão num anexo que ninguém releu. Este scanner informa as duas coisas. Os achados de metadados são graduados por quanto identificam, e o texto é comparado com padrões de endereços, cartões, identificadores nacionais e códigos de conta.
Recursos
- Lê autor, título, assunto, palavras-chave, produtor, criador e datas
- Detecta caminhos locais, que costumam expor um nome de usuário e uma árvore de pastas
- Encontra e-mails, telefones, IBAN, cartões, endereços IP e identificadores nacionais
- Números de cartão conferidos pelo algoritmo de Luhn para reduzir falsos positivos
- Cada exemplo é mascarado no relatório em vez de mostrado por inteiro
- Uma pontuação de risco única com uma leitura em linguagem simples
- Limpeza de todos os campos de metadados num clique, salva como novo documento
Como usar Scanner de privacidade de PDF
- Solte o PDF na página
- Leia os achados de metadados e os dados pessoais encontrados no texto
- Observe a pontuação de risco e decida o que precisa mudar
- Limpe os metadados, e tarje o conteúdo se os achados de texto importarem
Exemplo
Entrada
tender-response.pdf
Saída
High risk: author "J. Whitfield", path C:\Users\jwhitfield\Bids\…, 4 email addresses in the text.
O caminho é o achado que mais surpreende: ele nomeia a conta de usuário da máquina.
Erros comuns e solução de problemas
- A análise não relata nada. — Alguns produtores não gravam metadados, o que é um bom resultado. Confira os achados de texto separadamente: um dicionário de propriedades limpo não diz nada sobre o que está impresso na página.
- Um telefone encontrado é na verdade um número de referência. — Padrões de dígitos se sobrepõem. O scanner tende a relatar demais: leia o exemplo mascarado e descarte os que não são o que parecem.
- Limpar os metadados não tirou um nome da página. — Metadados e conteúdo da página são coisas diferentes. Um nome impresso no documento precisa ser tarjado da própria página.
- A análise de texto não achou nada num documento claramente cheio de dados. — O PDF é um escaneamento sem camada de texto, então não há o que comparar. Reconheça o texto primeiro e analise de novo.
Perguntas frequentes
- O que um PDF costuma vazar com mais frequência?
- O campo de autor, seguido do aplicativo que o produziu. Os dois são definidos automaticamente pelo que criou o arquivo, e nenhum aparece ao ler o documento.
- Meu documento é enviado para ser analisado?
- Não. Ler os metadados e comparar o texto acontecem nesta aba — subir um documento para checar a privacidade dele derrubaria o exercício.
- Por que os exemplos são mascarados?
- Para que o próprio relatório possa ser capturado ou compartilhado sem risco. Você vê que um endereço foi encontrado e mais ou menos qual, sem o valor completo na tela.
- Limpar os metadados muda as páginas?
- Não. Só as propriedades do documento são reescritas; cada página, seu texto e suas fontes ficam exatamente como estavam.
- Com que pontuação posso enviar tranquilo?
- Com qualquer uma que o scanner classifique como baixa. Média costuma significar um nome e uma data, aceitável internamente e conveniente de limpar antes de o documento sair.
Ferramentas relacionadas
Todas as ferramentas de ArrayKit