PDF 转 HTML
把 PDF 变成语义化、自适应的 HTML——标题、列表与段落都在。
PDF 转 HTML 会在你的设备上读取并重写文档。内部手册与客户报告绝不会被上传。
把 HTML 转回 PDF
关于 PDF 转 HTML
PDF 并不适合放到网上:它会被下载而不是打开,在手机上不重排,搜索引擎也只是勉强收录。要转换得体面,就得还原版面所暗示的结构,而不是把每一行裹进一个 div。这个工具把文字块归成行、把行归成段落,并把更大的行提升为标题,然后写出能说明每个块是什么的标记。你可以取整页——自适应,并自带明暗两套配色——也可以只取正文片段放进自己的模板,还能在每处分页上加一个可用于深链的标识。
功能特性
- 语义化标记:h1 到 h6、p、ul、li、blockquote、pre 与 table
- 折行的句子会接成真正的段落,而不是各占一行
- 可输出独立整页,或供自有模板使用的正文片段
- 整页是自适应的,并会跟随读者的明暗设置
- 可选在每处分页加上标识,便于深链到文档内部
- 标记旁边配有隔离框架中的渲染预览
- 可复制到剪贴板,或下载 .html 文件
如何使用 PDF 转 HTML
- 把 PDF 拖到页面上
- 选择整页还是正文片段
- 阅读渲染预览,确认结构无误
- 复制标记,或下载 .html 文件
示例
输入
handbook.pdf — 24 pages
输出
<h1>Staff handbook</h1>
<p>This handbook sets out…</p>
<h2>Working hours</h2>
标题层级来自每页正文的相对字号。
常见错误与故障排除
- 标记是空的。 — 这份 PDF 没有文字层。请先识别文字,再转换可搜索的版本。
- PDF 里的图片不见了。 — 只有文字会被转换。请另行把页面导出为图片,并在标记里引用它们。
- 所有标题都是同一层级。 — 文档把每个标题都排成同样大小,没有区分二级与三级的线索。在标记里手动调整一次即可。
- 页面装饰贯穿了整份文档。 — 书眉与页码在 PDF 里就是普通文字。对生成的标记做一次查找替换即可去掉。
常见问题
- 转成 HTML 会上传我的 PDF 吗?
- 不会。文字层在这个标签页里读取,标记也在这里生成,内部手册或客户报告不会离开你的设备。
- HTML 会像原来的 PDF 吗?
- 不会——它是为屏幕阅读而做的,也就是单栏、舒服的行长和自适应的版式。内容相同,设计不同。
- 放进 CMS 该用哪种输出?
- 正文片段。它没有头部、样式和外层容器,能直接嵌进现有模板而不打架。
- 生成的页面无障碍吗?
- 它用的是真正的标题、列表与表头单元格,这已是屏幕阅读器所需的大部分。请检查标题次序。
- 能把多个 PDF 转成一个页面吗?
- 先合并 PDF,再一次性转换——这样整份文档的标题层级才一致。
相关工具
全部 ArrayKit 工具