PDF OCR
识别扫描 PDF 里的文字,换回一份可以搜索、可以复制的文件。
PDF OCR 跑在你的设备上,扫描的档案与卷宗都留在你手里。只有语言数据会取一次,并由浏览器缓存。
把可检索的结果转成 Word
关于 PDF OCR
扫描的 PDF 是一份文档的照片。你能读,别的什么都读不了:搜索找不到,复制拿不到,任何靠文字工作的工具都无从下手。文字识别把这件事解决了——它读出字母的形状,并把认出的内容写回文件,成为一层正好覆在印刷文字之上、看不见的文字。页面看上去完全一样,扫描件没被动过,但这份文档从此可搜索、可选中、可转换。识别在你的浏览器里运行,支持十二种语言中的任意一种。
功能特性
- 识别在你的浏览器里运行——页面绝不上传
- 十二种语言,含印地语、俄语、中文、日语与阿拉伯语
- 不可见的文字层覆在原封不动的扫描件之上
- 两档扫描质量,在小字上权衡速度与准确
- 除可检索的 PDF 外,还提供纯文本输出
- 逐页显示进度,长文档可随时停下
- 语言数据只下载一次,之后由浏览器缓存
如何使用 PDF OCR
- 把扫描的 PDF 拖到页面上
- 选择页面上印的语言和一档扫描质量
- 开始识别,看着它逐页推进
- 下载可检索的 PDF,或只下载识别出的文字
示例
输入
1987-minutes.pdf — 8 scanned pages, typewritten English
输出
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
看得见的页面没有变化;变的是那些词现在真的在文件里了。
常见错误与故障排除
- 识别出的文字错得厉害。 — 识别的效果取决于扫描件。试试更高的质量档,并确认语言与页面相符——拿英语数据去认德语页面,结果正是如此。
- 识别非常慢。 — 这确实是很重的活儿,而且跑在你自己的处理器上而不是服务器上。请用较快的质量档,并把长文档拆开。
- 双语文档识别得很差。 — 每次运行只用一种语言。请按语言拆分文档,分别识别后再合并结果。
- 手写没有被识别出来。 — 这里识别的是印刷体与打字稿。手写需要完全另一类模型。
常见问题
- 识别出的文字会替换掉扫描件吗?
- 不会。图像原样保留,文字以不可见的方式加在它后面。这正是可检索 PDF 看上去和原件一模一样的原因。
- 识别时我扫描的页面会被上传吗?
- 不会。识别引擎跑在你的浏览器里。会去取的只有语言数据,而且只取一次,之后由浏览器缓存。
- 一次能识别多少页?
- 每次最多三十页,因为识别足够慢,长文档分批处理更合适。
- 该选哪一档质量?
- 先从快的那档开始。字小、扫描件年头久,或第一次结果很乱时,再换更高的一档。
- 能对已经有文字的 PDF 做 OCR 吗?
- 可以,但没有意义:先试着选中一个词看看。如果文字已经在了,直接转换就好。
相关工具
全部 ArrayKit 工具