PDF表单数据提取工具
把填好的PDF表单答案逐字段提取为JSON或CSV。
PDF表单数据提取工具完全在浏览器中运行。表单往往包含个人信息,这里只在你的设备上读取。
扁平化填好的表单
关于 PDF表单数据提取
填好的PDF表单把答案存在表单字段对象里,而不是页面文本中,所以复制表单文本只会得到所有标签,一个答案也拿不到。这个工具直接读取那些对象,并排成表格:文档中存储的字段名、类型、答案、下拉框提供的选项,以及字段所在的页。结果可以导出为扁平的名值JSON、带类型和标记的详细JSON,或者供电子表格和邮件合并使用的CSV。
功能特性
- 读取文本框、复选框、单选组、下拉框、列表和签名字段
- 按PDF存储的原样显示完整字段名
- 把下拉框的选项与所选值并列显示
- 标出必填和只读字段,并给出所在页码
- 按名称或答案筛选,可隐藏未填写的字段
- 导出为扁平JSON、详细JSON或CSV
- 统计已填与空白数量,便于发现遗漏
如何使用 PDF表单数据提取
- 把填好的PDF拖到页面上
- 浏览字段名与答案的表格
- 表单较长时可以筛选或隐藏空白字段
- 把数据复制或下载为JSON或CSV
示例
输入
W-9 with the name and address fields completed
输出
{
"topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
"topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}
字段名来自文档本身,因此与生成或处理该表单的系统一致。
常见错误与故障排除
- 一个字段都没找到。 — 这份表单很可能不是AcroForm。扫描的页面,或填写后打印成PDF的文件,答案是以图形形式存在的,需要文本提取或OCR。
- 字段名是f1_07[0]这种看不懂的字符串。 — 这是表单作者起的名字,政府表格尤其如此。页码和答案通常足以判断它对应哪个可见字段。
- 签名字段显示为空。 — 签名字段携带的是加密签名对象而不是文本值,因此没有可提取的内容。列出它只是为了让你知道它存在。
- 复选框显示Off或1而不是“是”。 — 复选框的导出值由表单作者决定。这里以勾选或空白呈现,详细导出会保留原始取值。
常见问题
- 为什么不能直接复制填好表单的文本?
- 因为答案并不属于页面文本。AcroForm字段是叠在页面上的独立对象,复制文本只会拿到印刷出来的标签。
- 什么是AcroForm?
- 这是PDF规范内置的交互表单层,提供文本框、复选框和下拉框。几乎所有可填写表单都在用它,老式XFA表单是主要例外。
- 能一次从多个表单提取数据吗?
- 这里一次处理一份文档,但CSV导出就是为叠加设计的:逐份处理、追加行,字段名会对齐,因为它们来自同一个模板。
- 提取数据会修改PDF吗?
- 不会。文件只被读取,不会写回,原文档保持不变。如果想把答案固定到页面上,那是扁平化要做的事。
- 对设了密码的表单有效吗?
- 只有无需密码即可打开时才行。用用户密码加密的文档必须先解密才能读取字段。
相关工具
全部 ArrayKit 工具