PDFのOCR
スキャンしたPDFの文字を認識し、検索もコピーもできるファイルにします。
PDFのOCRは端末上で動くため、読み取った記録や資料は手元に留まります。取得されるのは言語のデータだけで、一度きり保存されます。
検索できる結果をWordに変換する
PDFのOCR について
スキャンしたPDFは文書の写真です。人は読めますが、他の何ものも読めません。検索は何も見つけず、コピーは何も渡さず、文字を扱う道具はすべて手が出せません。文字認識はこれを解決します。字の形を読み取り、見つけたものを、印刷された語のちょうど上に重なる見えない層としてファイルに書き込みます。ページの見た目は同じままで、スキャンには触れません。それでいて文書は検索でき、選択でき、変換できるようになります。認識はブラウザ内で、12の言語のいずれかで動きます。
機能
- 認識はブラウザ内で動き、ページがアップロードされることはありません
- ヒンディー語、ロシア語、中国語、日本語、アラビア語を含む12言語
- 見えない文字の層が、手を加えない元のスキャンの上に重なります
- 小さな文字での速さと正確さを選べる2段階の読み取り品質
- 検索できるPDFに加えて、平文の書き出しも
- ページごとの進み具合と、長い文書のための停止操作
- 言語のデータは一度だけ取得され、ブラウザに保存されます
PDFのOCR の使い方
- スキャンしたPDFをページに置きます
- 紙面の言語と読み取り品質を選びます
- 認識を始め、ページが進む様子を見ます
- 検索できるPDF、または認識した文字だけをダウンロードします
例
入力
1987-minutes.pdf — 8 scanned pages, typewritten English
出力
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
見えているページは変わりません。変わるのは、語がファイルの中に入ったことです。
よくあるエラーとトラブルシューティング
- 認識した文字に誤りが多いです。 — 認識はスキャンの質に左右されます。高いほうの品質を試し、言語が紙面と合っているか確かめてください。ドイツ語の紙面に英語のデータを当てると、まさにこうなります。
- 認識がとても遅いです。 — 本当に重い処理で、しかもサーバーではなくご自身のプロセッサで動いています。速いほうの品質を使い、長い文書は分けてください。
- 二か国語の文書がうまく認識されません。 — 一度の実行で使う言語は一つです。言語ごとに文書を分け、それぞれ認識して結果を結合してください。
- 手書きが認識されませんでした。 — これは印刷とタイプ打ちの文字を認識します。手書きにはまったく別種のモデルが要ります。
よくある質問
- 認識した文字はスキャンを置き換えますか。
- いいえ。画像はそのままで、文字はその背後に見えない形で加わります。検索できるPDFが元と同じに見えるのはそのためです。
- 認識のためにスキャンしたページはアップロードされますか。
- いいえ。認識の仕組みはブラウザ内で動きます。取得されるのは言語のデータだけで、それも一度きり、以後はブラウザが保存します。
- 一度に何ページ認識できますか。
- 一回の実行で30ページまでです。認識は十分に遅いので、長い文書はいくつかに分けたほうが扱いやすくなります。
- どちらの品質を選ぶべきですか。
- まず速いほうから始めてください。文字が小さい、スキャンが古い、最初の結果が乱れている場合に高いほうへ移ります。
- すでに文字のあるPDFにOCRをかけられますか。
- かけられますが、意味はありません。まず語を選択できるか試してください。文字があるなら、そのまま変換してください。
関連ツール
すべての ArrayKit ツール