PDF OCR

识别扫描 PDF 里的文字,换回一份可以搜索、可以复制的文件。

PDF OCR 跑在你的设备上,扫描的档案与卷宗都留在你手里。只有语言数据会取一次,并由浏览器缓存。

把可检索的结果转成 Word

关于 PDF OCR

扫描的 PDF 是一份文档的照片。你能读,别的什么都读不了:搜索找不到,复制拿不到,任何靠文字工作的工具都无从下手。文字识别把这件事解决了——它读出字母的形状,并把认出的内容写回文件,成为一层正好覆在印刷文字之上、看不见的文字。页面看上去完全一样,扫描件没被动过,但这份文档从此可搜索、可选中、可转换。识别在你的浏览器里运行,支持十二种语言中的任意一种。

功能特性

如何使用 PDF OCR

  1. 把扫描的 PDF 拖到页面上
  2. 选择页面上印的语言和一档扫描质量
  3. 开始识别,看着它逐页推进
  4. 下载可检索的 PDF,或只下载识别出的文字

示例

输入

1987-minutes.pdf — 8 scanned pages, typewritten English

输出

1987-minutes-searchable.pdf — same images, now with selectable text behind them.

看得见的页面没有变化;变的是那些词现在真的在文件里了。

常见错误与故障排除

常见问题

识别出的文字会替换掉扫描件吗?
不会。图像原样保留,文字以不可见的方式加在它后面。这正是可检索 PDF 看上去和原件一模一样的原因。
识别时我扫描的页面会被上传吗?
不会。识别引擎跑在你的浏览器里。会去取的只有语言数据,而且只取一次,之后由浏览器缓存。
一次能识别多少页?
每次最多三十页,因为识别足够慢,长文档分批处理更合适。
该选哪一档质量?
先从快的那档开始。字小、扫描件年头久,或第一次结果很乱时,再换更高的一档。
能对已经有文字的 PDF 做 OCR 吗?
可以,但没有意义:先试着选中一个词看看。如果文字已经在了,直接转换就好。

相关工具

全部 ArrayKit 工具