PDFのOCR

スキャンしたPDFの文字を認識し、検索もコピーもできるファイルにします。

PDFのOCRは端末上で動くため、読み取った記録や資料は手元に留まります。取得されるのは言語のデータだけで、一度きり保存されます。

検索できる結果をWordに変換する

PDFのOCR について

スキャンしたPDFは文書の写真です。人は読めますが、他の何ものも読めません。検索は何も見つけず、コピーは何も渡さず、文字を扱う道具はすべて手が出せません。文字認識はこれを解決します。字の形を読み取り、見つけたものを、印刷された語のちょうど上に重なる見えない層としてファイルに書き込みます。ページの見た目は同じままで、スキャンには触れません。それでいて文書は検索でき、選択でき、変換できるようになります。認識はブラウザ内で、12の言語のいずれかで動きます。

機能

PDFのOCR の使い方

  1. スキャンしたPDFをページに置きます
  2. 紙面の言語と読み取り品質を選びます
  3. 認識を始め、ページが進む様子を見ます
  4. 検索できるPDF、または認識した文字だけをダウンロードします

入力

1987-minutes.pdf — 8 scanned pages, typewritten English

出力

1987-minutes-searchable.pdf — same images, now with selectable text behind them.

見えているページは変わりません。変わるのは、語がファイルの中に入ったことです。

よくあるエラーとトラブルシューティング

よくある質問

認識した文字はスキャンを置き換えますか。
いいえ。画像はそのままで、文字はその背後に見えない形で加わります。検索できるPDFが元と同じに見えるのはそのためです。
認識のためにスキャンしたページはアップロードされますか。
いいえ。認識の仕組みはブラウザ内で動きます。取得されるのは言語のデータだけで、それも一度きり、以後はブラウザが保存します。
一度に何ページ認識できますか。
一回の実行で30ページまでです。認識は十分に遅いので、長い文書はいくつかに分けたほうが扱いやすくなります。
どちらの品質を選ぶべきですか。
まず速いほうから始めてください。文字が小さい、スキャンが古い、最初の結果が乱れている場合に高いほうへ移ります。
すでに文字のあるPDFにOCRをかけられますか。
かけられますが、意味はありません。まず語を選択できるか試してください。文字があるなら、そのまま変換してください。

関連ツール

すべての ArrayKit ツール