PDFフォームデータ抽出ツール

記入済みPDFフォームの回答を、フィールドごとにJSONやCSVで取り出します。

PDFフォームデータ抽出ツールはすべてブラウザ内で動作します。個人情報を含むことが多いフォームも端末内で読み取られます。

記入済みフォームを平坦化する

PDFフォームデータ抽出 について

記入済みのPDFフォームは、回答をページのテキストではなくフォームフィールドのオブジェクトに保持します。だからフォームのテキストをコピーするとラベルばかりが取れて入力内容は一つも取れません。このツールはそのオブジェクトを直接読み、表として並べます。文書が保持しているとおりのフィールド名、型、回答、ドロップダウンの選択肢、そしてフィールドがあるページです。結果は名前と値だけの平坦なJSON、型やフラグを含む詳細なJSON、表計算や差し込み印刷用のCSVとして書き出せます。

機能

PDFフォームデータ抽出 の使い方

  1. 記入済みのPDFをページに置きます
  2. フィールド名と回答の表を確認します
  3. フォームが長ければ絞り込むか空欄を隠します
  4. データをJSONかCSVでコピーまたは保存します

入力

W-9 with the name and address fields completed

出力

{
  "topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
  "topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}

フィールド名は文書由来なので、フォームを作った側や処理する側と一致します。

よくあるエラーとトラブルシューティング

よくある質問

記入済みフォームのテキストをそのままコピーできないのはなぜですか。
回答がページのテキストの一部ではないからです。AcroFormのフィールドはページの上に重ねられた別のオブジェクトで、テキストのコピーでは印字されたラベルしか取れません。
AcroFormとは何ですか。
PDF仕様に組み込まれた対話的フォームの層で、テキスト欄やチェックボックス、ドロップダウンを提供します。記入できるフォームのほとんどがこれを使い、古いXFA形式が主な例外です。
複数のフォームからまとめて抽出できますか。
ここでは一度に一つですが、CSVの書き出しは積み重ねを想定しています。同じテンプレートならフィールド名が一致するので、行を足していけます。
抽出するとPDFは変わりますか。
変わりません。ファイルは読み取るだけで書き戻しはせず、元の文書はそのままです。回答をページに固定したい場合は平坦化を使います。
パスワード付きのフォームでも動きますか。
パスワードなしで開けるものに限ります。利用者パスワードで暗号化された文書は、先に復号する必要があります。

関連ツール

すべての ArrayKit ツール