Extracteur de données de formulaire PDF
Récupérez les réponses d’un formulaire PDF rempli en JSON ou CSV, champ par champ.
L’extracteur de données de formulaire PDF fonctionne entièrement dans votre navigateur. Les formulaires contiennent souvent des données personnelles, lues ici sur votre appareil.
Aplatir un formulaire rempli
À propos de Extracteur de formulaire PDF
Un formulaire PDF rempli conserve ses réponses dans des objets de champ et non dans le texte de la page : copier le texte d’un formulaire donne donc toutes les étiquettes et aucune des saisies. Cet outil lit ces objets directement et les présente en tableau : le nom du champ tel que le document le stocke, le type, la réponse, les choix qu’offrait une liste déroulante et la page où se trouve le champ. Le résultat s’exporte en objet JSON plat nom-valeur, en JSON détaillé avec types et indicateurs, ou en CSV pour un tableur ou un publipostage.
Fonctionnalités
- Lit champs de texte, cases à cocher, groupes de boutons, listes déroulantes et signatures
- Affiche le nom complet du champ tel que le PDF le stocke
- Liste les options d’une liste déroulante à côté de la sélection
- Signale les champs obligatoires et en lecture seule, et indique la page
- Filtre par nom ou réponse et masque les champs vides
- Export en JSON plat, JSON détaillé ou CSV
- Compte les champs remplis face aux vides pour repérer les manques
Comment utiliser Extracteur de formulaire PDF
- Déposez le PDF rempli sur la page
- Parcourez le tableau des noms de champ et des réponses
- Filtrez ou masquez les champs vides si le formulaire est long
- Copiez ou téléchargez les données en JSON ou CSV
Exemple
Entrée
W-9 with the name and address fields completed
Sortie
{
"topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
"topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}
Les noms de champ viennent du document et correspondent donc à ce qui a produit le formulaire.
Erreurs courantes et dépannage
- Aucun champ n’est trouvé. — Le formulaire n’est sans doute pas un AcroForm. Une page numérisée, ou imprimée en PDF après remplissage, garde les réponses en graphique : il faut alors une extraction de texte ou de l’OCR.
- Les noms de champ sont illisibles, du genre f1_07[0]. — C’est ainsi que l’auteur du formulaire les a nommés, et les formulaires administratifs sont les pires. La page et la réponse indiquent en général de quel champ visible il s’agit.
- Un champ de signature ressort vide. — Les champs de signature portent un objet cryptographique et non une valeur texte : il n’y a rien à extraire. Le champ est listé pour signaler son existence.
- Une case affiche Off ou 1 plutôt que Oui. — Les valeurs d’export des cases sont définies par l’auteur du formulaire. Elles apparaissent ici cochées ou vides, et l’export détaillé conserve les valeurs sous-jacentes.
Foire aux questions
- Pourquoi ne puis-je pas simplement copier le texte d’un formulaire rempli ?
- Parce que les réponses ne font pas partie du texte de la page. Les champs AcroForm sont des objets distincts superposés, une copie de texte rend donc les étiquettes imprimées et laisse les saisies.
- Qu’est-ce qu’un AcroForm ?
- La couche de formulaire interactif intégrée à la spécification PDF, celle qui apporte champs de texte, cases et listes déroulantes. Presque tout formulaire à remplir l’utilise, les anciens XFA mis à part.
- Puis-je extraire les données de plusieurs formulaires à la fois ?
- Un document à la fois ici, mais l’export CSV est prévu pour être empilé : traitez chaque formulaire, ajoutez les lignes, et les noms de champ coïncideront puisqu’ils viennent du même modèle.
- L’extraction modifie-t-elle le PDF ?
- Non. Le fichier est lu et rien n’est réécrit, l’original reste intact. Pour figer les réponses dans la page, c’est l’aplatissement qu’il faut.
- Cela marche-t-il sur un formulaire protégé par mot de passe ?
- Seulement s’il s’ouvre sans mot de passe. Un document chiffré avec un mot de passe utilisateur doit d’abord être déchiffré.
Outils associés
Tous les outils ArrayKit