PDFフォームデータ抽出ツール
記入済みPDFフォームの回答を、フィールドごとにJSONやCSVで取り出します。
PDFフォームデータ抽出ツールはすべてブラウザ内で動作します。個人情報を含むことが多いフォームも端末内で読み取られます。
記入済みフォームを平坦化する
PDFフォームデータ抽出 について
記入済みのPDFフォームは、回答をページのテキストではなくフォームフィールドのオブジェクトに保持します。だからフォームのテキストをコピーするとラベルばかりが取れて入力内容は一つも取れません。このツールはそのオブジェクトを直接読み、表として並べます。文書が保持しているとおりのフィールド名、型、回答、ドロップダウンの選択肢、そしてフィールドがあるページです。結果は名前と値だけの平坦なJSON、型やフラグを含む詳細なJSON、表計算や差し込み印刷用のCSVとして書き出せます。
機能
- テキスト欄、チェックボックス、ラジオ、ドロップダウン、リスト、署名欄を読み取り
- PDFが保持しているとおりの完全なフィールド名を表示
- ドロップダウンの選択肢を選択値と並べて表示
- 必須と読み取り専用を示し、フィールドのあるページを表示
- 名前や回答で絞り込み、未記入のフィールドを隠せます
- 平坦なJSON、詳細なJSON、CSVで書き出し
- 記入済みと空欄の数を数え、抜けが見えます
PDFフォームデータ抽出 の使い方
- 記入済みのPDFをページに置きます
- フィールド名と回答の表を確認します
- フォームが長ければ絞り込むか空欄を隠します
- データをJSONかCSVでコピーまたは保存します
例
入力
W-9 with the name and address fields completed
出力
{
"topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
"topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}
フィールド名は文書由来なので、フォームを作った側や処理する側と一致します。
よくあるエラーとトラブルシューティング
- フィールドが一つも見つからない。 — AcroFormではない可能性が高いです。スキャンしたページや記入後にPDF出力したものは回答が画像として入っているため、テキスト抽出やOCRが必要です。
- フィールド名がf1_07[0]のように読めない。 — 作成者がそう名付けたためで、官公庁の様式に多く見られます。ページと回答からどの欄かはたいてい判別できます。
- 署名欄が空で表示される。 — 署名欄は文字列ではなく暗号署名のオブジェクトを持つため、抽出できる値がありません。存在を示すために一覧には載せています。
- チェックボックスがはいではなくOffや1と出る。 — チェックボックスの書き出し値は作成者が決めます。ここではチェック済みか空欄かで示し、詳細な書き出しでは元の値を残します。
よくある質問
- 記入済みフォームのテキストをそのままコピーできないのはなぜですか。
- 回答がページのテキストの一部ではないからです。AcroFormのフィールドはページの上に重ねられた別のオブジェクトで、テキストのコピーでは印字されたラベルしか取れません。
- AcroFormとは何ですか。
- PDF仕様に組み込まれた対話的フォームの層で、テキスト欄やチェックボックス、ドロップダウンを提供します。記入できるフォームのほとんどがこれを使い、古いXFA形式が主な例外です。
- 複数のフォームからまとめて抽出できますか。
- ここでは一度に一つですが、CSVの書き出しは積み重ねを想定しています。同じテンプレートならフィールド名が一致するので、行を足していけます。
- 抽出するとPDFは変わりますか。
- 変わりません。ファイルは読み取るだけで書き戻しはせず、元の文書はそのままです。回答をページに固定したい場合は平坦化を使います。
- パスワード付きのフォームでも動きますか。
- パスワードなしで開けるものに限ります。利用者パスワードで暗号化された文書は、先に復号する必要があります。
関連ツール
すべての ArrayKit ツール