Extrator de dados de formulário PDF
Tire as respostas de um formulário PDF preenchido como JSON ou CSV, campo por campo.
O Extrator de dados de formulário PDF roda inteiramente no seu navegador. Formulários costumam conter dados pessoais e aqui são lidos no seu dispositivo.
Achatar um formulário preenchido
Sobre Extrator de formulário PDF
Um formulário PDF preenchido guarda as respostas em objetos de campo e não no texto da página, e por isso copiar o texto de um formulário devolve todos os rótulos e nenhuma das respostas. Esta ferramenta lê esses objetos diretamente e os apresenta em uma tabela: o nome do campo exatamente como o documento guarda, o tipo, a resposta, as opções que um menu oferecia e a página em que o campo está. O resultado é exportado como objeto JSON simples de nome para valor, como JSON detalhado com tipos e marcações, ou como CSV para uma planilha ou uma mala direta.
Recursos
- Lê campos de texto, caixas de seleção, grupos de opção, menus, listas e assinaturas
- Mostra o nome completo do campo exatamente como o PDF o guarda
- Lista as opções de um menu ao lado da seleção
- Marca campos obrigatórios e somente leitura, e indica a página
- Filtra por nome ou resposta e esconde os campos não preenchidos
- Exporta como JSON simples, JSON detalhado ou CSV
- Conta preenchidos contra vazios para ver o que falta no formulário
Como usar Extrator de formulário PDF
- Arraste o PDF preenchido para a página
- Percorra a tabela de nomes de campo e respostas
- Filtre ou esconda os campos vazios se o formulário for longo
- Copie ou baixe os dados em JSON ou CSV
Exemplo
Entrada
W-9 with the name and address fields completed
Saída
{
"topmostSubform[0].Page1[0].f1_01[0]": "Ada Lovelace",
"topmostSubform[0].Page1[0].f1_07[0]": "12 Baker Street"
}
Os nomes de campo vêm do documento, então batem com o que gerou ou processa o formulário.
Erros comuns e solução de problemas
- Nenhum campo é encontrado. — Provavelmente o formulário não é um AcroForm. Uma página digitalizada, ou impressa em PDF depois de preenchida, guarda as respostas como gráficos: isso exige extração de texto ou OCR.
- Os nomes de campo são cadeias ilegíveis como f1_07[0]. — Foi assim que quem criou o formulário os nomeou, e formulários oficiais são os piores. A página e a resposta em geral deixam claro a que campo visível cada um corresponde.
- Um campo de assinatura sai vazio. — Campos de assinatura carregam um objeto criptográfico e não um valor de texto, então não há nada a extrair. O campo é listado para você saber que existe.
- Uma caixa mostra um valor como Off ou 1 em vez de Sim. — Os valores de exportação das caixas são definidos por quem criou o formulário. Aqui aparecem como marcadas ou vazias, e a exportação detalhada preserva os valores originais.
Perguntas frequentes
- Por que não consigo copiar o texto de um formulário preenchido?
- Porque as respostas não fazem parte do texto da página. Campos AcroForm são objetos separados sobrepostos, então uma cópia de texto devolve os rótulos impressos e deixa de fora o que foi digitado.
- O que é um AcroForm?
- A camada de formulário interativo embutida na especificação PDF: a que dá caixas de texto, caixas de seleção e menus. É o que quase todo formulário preenchível usa, com os antigos formulários XFA como principal exceção.
- Posso extrair dados de vários formulários de uma vez?
- Aqui é um documento por vez, mas a exportação CSV foi feita para empilhar: rode cada formulário, acrescente as linhas e os nomes de campo vão bater porque vêm do mesmo modelo.
- Extrair os dados altera o PDF?
- Não. O arquivo é lido e nada é escrito de volta, então o documento original fica intacto. Se você quiser fixar as respostas na página, isso é o que o achatamento faz.
- Funciona em um formulário protegido por senha?
- Só se ele abrir sem senha. Um documento cifrado com senha de usuário precisa ser descriptografado antes de os campos poderem ser lidos.
Ferramentas relacionadas
Todas as ferramentas de ArrayKit