PDF 隐私扫描
发出去之前看清楚:这份 PDF 带着哪些元数据、路径和个人信息。
PDF 隐私扫描在你的设备上读取文档,并对报告里的每个示例打码。关于这份文件的任何内容都不会被上传或记录。
把页面上印着的内容涂黑
关于 PDF 隐私扫描
每一份 PDF 带着的,都比页面上显示的更多。属性字典通常写着作者,记录了是哪个应用在什么时候生成了文件,有时还留着一条本机路径,里面既有用户名也有文件夹结构。文字层里可能更多:页脚里的一个邮箱、表格里的一个账号、附录里一个没人复看过的卡号。这个扫描器两边都报。元数据发现按可识别程度分级,正文则与地址、卡号、国民证件号和账号格式逐一比对,示例一律打码。
功能特性
- 读取作者、标题、主题、关键词、生成器与时间戳
- 识别本机路径,它往往连用户名和目录结构一并暴露
- 匹配邮箱、电话、IBAN、卡号、IP 地址与国民证件号
- 卡号会过一遍 Luhn 校验,减少误报
- 报告里的每个示例都打码,而不是完整展示
- 一个总的风险分值,附带一句大白话的解读
- 一键清空全部元数据字段,另存为新文档
如何使用 PDF 隐私扫描
- 把 PDF 拖到页面上
- 阅读元数据发现,以及正文中匹配到的个人信息
- 看一眼风险分值,判断该改什么
- 清空元数据;若正文发现要紧,再对页面内容做涂黑
示例
输入
tender-response.pdf
输出
High risk: author "J. Whitfield", path C:\Users\jwhitfield\Bids\…, 4 email addresses in the text.
最让人意外的往往是路径:它会报出这台机器的用户账号名。
常见错误与故障排除
- 扫描什么也没报。 — 有些生成器根本不写元数据,这是好结果。请另外看正文发现——干净的属性字典说明不了页面上印着什么。
- 匹配到的电话其实是一个流水号。 — 数字格式会重叠。扫描器偏向多报:看一眼打码示例,把不对的排除掉。
- 清空元数据后,页面上的姓名还在。 — 元数据与页面内容是两回事。印在文档上的姓名,得从页面本身涂黑。
- 一份明显满是数据的文档,正文扫描却什么都没找到。 — 这份 PDF 是没有文字层的扫描件,没有可比对的内容。请先识别文字,再扫描一次。
常见问题
- PDF 最常泄露的是什么?
- 作者字段,其次是生成它的应用。两者都由制作文件的程序自动写入,读文档时又都看不见。
- 扫描时我的文档会被上传吗?
- 不会。读元数据与比对正文都在这个标签页里完成——为了检查隐私而把文档传出去,本身就自相矛盾。
- 示例为什么要打码?
- 这样报告本身也能安心截图或分享。你能看到找到了一个地址、大致是哪一个,而完整的值不会出现在屏幕上。
- 清空元数据会改动页面吗?
- 不会。只有文档属性被重写;每一页、页上的文字与字体都原封不动。
- 分值到什么程度可以放心发出?
- 扫描器判为低的都可以。中等通常意味着一个姓名和一个时间戳,内部无妨,对外发之前清掉更稳妥。
相关工具
全部 ArrayKit 工具