PDF 转 Word
把 PDF 重建成真正能编辑的 .docx,标题与列表都会被识别。
PDF 转 Word 的读取与 .docx 写出全部在你的设备上完成。合同与报告绝不会被上传。
先识别扫描 PDF 里的文字
关于 PDF 转 Word
PDF 记录的是每一段文字碎片落在哪里,而不是它意味着什么。要拿回一份可编辑的文档,就得读出这些位置并推断结构:共用同一基线的碎片是一行,明显大于正文的一行是标题,远未到栏边就收住的一行是段落结束而非折行,以标记或数字开头的一行是列表项。这个转换器先做完这些,再写出一份带 Word 标题样式、列表段落与表格的真正 .docx。它找到的结构会先在屏幕上列出来。
功能特性
- 文字的位置与大小读自 PDF,而不是从图片上猜
- 更大更粗的行会提升为标题 1 到 4 样式
- 折行的句子会重新接成完整段落
- 带标记与编号的行保留为列表段落
- 可选保留分页符,让文档维持原来的分页
- 下载前提供逐块的结构预览
- 写出标准 .docx,Word、Pages 与 LibreOffice 都能打开
如何使用 PDF 转 Word
- 把 PDF 拖到页面上
- 查看识别出的标题、段落与列表项
- 决定是否保留分页符、是否记录作者
- 下载 .docx
示例
输入
specification.pdf — 12 pages
输出
specification.docx with 9 headings, 84 paragraphs and the list items kept as bullets.
标题是按每页正文的相对字号推断出来的。
常见错误与故障排除
- 文档是空的。 — 这份 PDF 没有文字层——它是扫描件。请先做文字识别,再转换识别后的结果。
- 页眉页脚变成了零散的段落。 — 书眉和正文一样位于文字层里。在 Word 里删一次,然后改用它自己的页眉页脚功能。
- 双栏页面被横着读了。 — 行是按基线归组的,所以并排的两栏会交错。多栏版面天生就不适合这样转换。
- 每一行都变成了独立段落。 — 当各行结束的宽度差异很大时会这样,比如诗歌或代码。结果仍可编辑,在 Word 里按需要合并即可。
常见问题
- PDF 会被送到某个转换服务吗?
- 不会。文字层在这个标签页里读取,.docx 也在这里写出。法律草案与财务报告都留在你的机器上。
- Word 文件会和 PDF 长得一模一样吗?
- 不会,这正是重点——可编辑的文档会重排。标题、列表与阅读顺序会带过来,精确的位置不会。
- PDF 里的图片会包含在 .docx 里吗?
- 不会。这个转换器重建的是文字。需要图形的话,请另行把页面导出为图片。
- 它能转换扫描件吗?
- 不能直接转换,因为扫描件是没有文字的图片。先做文字识别,识别后的版本就能正常转换。
- 它生成 .doc 还是 .docx?
- .docx——现代的 Office Open XML 包。Word、Pages、Google 文档与 LibreOffice 的现行版本都能读。
相关工具
全部 ArrayKit 工具