PDF 转 HTML

把 PDF 变成语义化、自适应的 HTML——标题、列表与段落都在。

PDF 转 HTML 会在你的设备上读取并重写文档。内部手册与客户报告绝不会被上传。

把 HTML 转回 PDF

关于 PDF 转 HTML

PDF 并不适合放到网上:它会被下载而不是打开,在手机上不重排,搜索引擎也只是勉强收录。要转换得体面,就得还原版面所暗示的结构,而不是把每一行裹进一个 div。这个工具把文字块归成行、把行归成段落,并把更大的行提升为标题,然后写出能说明每个块是什么的标记。你可以取整页——自适应,并自带明暗两套配色——也可以只取正文片段放进自己的模板,还能在每处分页上加一个可用于深链的标识。

功能特性

如何使用 PDF 转 HTML

  1. 把 PDF 拖到页面上
  2. 选择整页还是正文片段
  3. 阅读渲染预览,确认结构无误
  4. 复制标记,或下载 .html 文件

示例

输入

handbook.pdf — 24 pages

输出

<h1>Staff handbook</h1>
<p>This handbook sets out…</p>
<h2>Working hours</h2>

标题层级来自每页正文的相对字号。

常见错误与故障排除

常见问题

转成 HTML 会上传我的 PDF 吗?
不会。文字层在这个标签页里读取,标记也在这里生成,内部手册或客户报告不会离开你的设备。
HTML 会像原来的 PDF 吗?
不会——它是为屏幕阅读而做的,也就是单栏、舒服的行长和自适应的版式。内容相同,设计不同。
放进 CMS 该用哪种输出?
正文片段。它没有头部、样式和外层容器,能直接嵌进现有模板而不打架。
生成的页面无障碍吗?
它用的是真正的标题、列表与表头单元格,这已是屏幕阅读器所需的大部分。请检查标题次序。
能把多个 PDF 转成一个页面吗?
先合并 PDF,再一次性转换——这样整份文档的标题层级才一致。

相关工具

全部 ArrayKit 工具