Extractor de datos de formularios PDF
Saca las respuestas de un formulario PDF relleno como JSON o CSV, campo por campo.
El Extractor de datos de formularios PDF funciona por completo en tu navegador. Los formularios suelen contener datos personales y aquí se analizan en tu dispositivo.
Aplanar un formulario relleno
Acerca de Extractor de formularios PDF
Un formulario PDF relleno guarda sus respuestas en objetos de campo y no en el texto de la página, y por eso copiar el texto de un formulario te da todas las etiquetas y ninguna de las respuestas. Esta herramienta lee esos objetos directamente y los presenta en una tabla: el nombre del campo tal y como lo guarda el documento, el tipo, la respuesta, las opciones que ofrecía un desplegable y la página en la que está el campo. El resultado se exporta como objeto JSON plano de nombre a valor, como JSON detallado con tipos y marcas, o como CSV para una hoja de cálculo o una combinación de correspondencia.
Características
- Lee campos de texto, casillas, grupos de opción, desplegables, listas y firmas
- Muestra el nombre completo del campo tal y como lo guarda el PDF
- Enumera las opciones de un desplegable junto a la selección
- Marca los campos obligatorios y de solo lectura, e indica su página
- Filtra por nombre o respuesta y oculta los campos sin rellenar
- Exporta como JSON plano, JSON detallado o CSV
- Cuenta rellenos frente a vacíos para ver qué falta en un formulario
Cómo usar Extractor de formularios PDF
- Arrastra el PDF relleno a la página
- Revisa la tabla de nombres de campo y respuestas
- Filtra u oculta los campos vacíos si el formulario es largo
- Copia o descarga los datos en JSON o CSV
Ejemplo
Entrada
W-9 with the name and address fields completed
Salida
{
"topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
"topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}
Los nombres de campo vienen del documento, así que coinciden con lo que generó o procesa el formulario.
Errores comunes y solución de problemas
- No se encuentra ningún campo. — Probablemente el formulario no sea un AcroForm. Una página escaneada, o impresa a PDF tras rellenarla, guarda las respuestas como gráficos: eso requiere extracción de texto u OCR.
- Los nombres de campo son cadenas ilegibles como f1_07[0]. — Así los llamó quien creó el formulario, y los formularios oficiales son los peores. La página y la respuesta suelen dejar claro a qué campo visible corresponde cada uno.
- Un campo de firma sale vacío. — Los campos de firma llevan un objeto criptográfico y no un valor de texto, así que no hay nada que extraer. El campo se lista para que sepas que existe.
- Una casilla muestra un valor como Off o 1 en vez de Sí. — Los valores de exportación de las casillas los define quien crea el formulario. Aquí se muestran como marcadas o vacías, y la exportación detallada conserva los valores originales.
Preguntas frecuentes
- ¿Por qué no puedo copiar el texto de un formulario relleno?
- Porque las respuestas no forman parte del texto de la página. Los campos AcroForm son objetos aparte superpuestos, así que una copia de texto devuelve las etiquetas impresas y deja fuera lo escrito.
- ¿Qué es un AcroForm?
- La capa de formulario interactivo integrada en la especificación PDF: la que da cuadros de texto, casillas y desplegables. Es lo que usa casi todo formulario rellenable, con los formularios XFA antiguos como principal excepción.
- ¿Puedo extraer datos de varios formularios a la vez?
- Aquí de uno en uno, pero la exportación CSV está pensada para apilarse: procesa cada formulario, añade las filas y los nombres de campo encajarán porque vienen de la misma plantilla.
- ¿Extraer los datos modifica el PDF?
- No. El fichero se lee y no se escribe nada, así que el documento original queda intacto. Si quieres fijar las respuestas en la página, eso es lo que hace el aplanado.
- ¿Funciona con un formulario protegido con contraseña?
- Solo si se abre sin contraseña. Un documento cifrado con contraseña de usuario debe descifrarse antes de poder leer sus campos.
Herramientas relacionadas
- Aplanar PDF — Fija los campos de un formulario relleno en la página.
- PDF a texto — Extrae texto seleccionable de un PDF como texto plano o Markdown.
- Editor de metadatos PDF — Ve, edita o borra título, autor y demás campos de un PDF.
- Combinar PDF — Combina varios PDF en uno, con reordenación.
- Dividir PDF — Extrae páginas o rangos (p. ej. 1-3,5,7-9) en un PDF nuevo.
- Descifrar PDF — Elimina la protección por contraseña de un PDF cifrado.
Todas las herramientas de ArrayKit