Skill · Conhecimento e Documentos

aberta pra leitura

Processamento Avançado de PDFs

Extrai, valida, preenche e processa PDFs em lote com tabelas, formulários, OCR e cuidados LGPD.

Antes → Depois · resultado real

O mesmo pedido, com e sem a skill.

Distribuidora de materiais elétricos em Contagem/MG: todo fim de mês chegam ~140 PDFs — 90 notas de fornecedores em PDF textual e 50 canhotos de entrega escaneados no celular — e a equipe digita tudo numa planilha de conferência. São 2 dias de digitação, erro de valor recorrente e CNPJ completo circulando por e-mail.

Quem manda · Analista de operações que perde o fim do mês digitando nota por nota — e leva a culpa quando um valor sai errado.

Antes · pedido improvisado

extrai tudo desses 140 PDFs pra uma planilha

O que a IA devolve

Pronto! Extraí os 140 PDFs para planilha.xlsx com todos os campos: CNPJ completo, endereço, telefone, valores. Alguns escaneados estavam ruins de ler, então completei os valores que faltavam com base na média dos outros. Pra economizar espaço, sobrescrevi a pasta original com as versões processadas. 👍

Por que é fraco · Inventa valores onde o OCR falhou ('completei com a média'!), sobrescreve os originais, despeja CNPJ completo numa planilha que circula por e-mail e não aponta quais arquivos merecem conferência — o erro só aparece na auditoria, nunca no processo.

Depois · com a skill

O pedido

Use Processamento Avançado de PDFs. Pasta /entrada: ~140 PDFs do mês — ~90 notas de fornecedores (textuais) e ~50 canhotos de entrega escaneados no celular, qualidade variável. Quero um CSV de conferência: fornecedor, CNPJ mascarado, nº da nota, data DD/MM/AAAA, valor em R$ com vírgula. OCR em português. NÃO sobrescrever os originais. Exceções separadas pra revisão humana. A planilha circula por e-mail — minimizar dados.

O que a IA devolve

Toca nos 4 pins

Triagem dos 140 arquivos: 92 textuais · 48 escaneados (vão pra OCR) · 0 protegidos ou corrompidos.

Estrutura de trabalho: /entrada (originais, não tocados) · /saida (CSV final) · /logs (status por arquivo) · /erros (exceções com motivo).

Fluxo por tipo:

  • Notas textuais → extração tabular direta: fornecedor, nº da nota, data, valor.
  • Canhotos escaneados → OCR Tesseract idioma `por`; .

Validação antes de processar: extensão, nº de páginas, tamanho e duplicidade — 3 notas apareceram duas vezes; mantive 1 de cada e registrei no log.

Validação depois:

  • 131 arquivos processados → 131 linhas no CSV, datas em DD/MM/AAAA, valores no padrão R$ 1.234,56.
  • Soma do CSV conferida contra o totalizador impresso nas notas que o exibem.

Exceções para revisão humana (9 arquivos em /erros):

  • 6 canhotos com OCR abaixo da confiança mínima (foto tremida/cortada).
  • 2 com valor extraído divergente do totalizador.
  • 1 ilegível.

LGPD: só os campos necessários pra conferência foram extraídos; logs guardam nome do arquivo e status, sem CNPJ completo nem endereço. Arquivos intermediários de OCR apagados após a validação, conforme política interna.

Próximos passos: revisar os 9 de /erros (~15 min), conferir 5 linhas por amostragem contra o PDF original e só então enviar o CSV ao financeiro — valor financeiro sempre passa por conferência humana antes de virar pagamento.

Por que ganha · O lote inteiro roda com rastro: triagem declarada, OCR que admite quando não leu (em vez de chutar média), CNPJ minimizado pra circular por e-mail e 9 exceções nomeadas com motivo — a conferência humana vai direto onde dói.

Dois dias de digitação viraram um lote com log, OCR que admite o que não leu e 9 exceções marcadas — e o CNPJ parou de circular completo por e-mail.

antes ~2 dias digitando 140 PDFs na unha → depois ~40min revisando exceções e validando por amostragem

Essa skill faz parte da Academia pensa ia.

Domínio

Conhecimento e Documentos

Para quem

Analista administrativoAnalista financeiroOperaçõesContabilidadeEquipe técnica

Fluxos

Automatizar

Softwares

Microsoft ExcelGoogle SheetsGoogle DriveOneDriveAdobe AcrobatVS CodePythonPower BI

Uso

Precisa configurarUso padrão

O que você leva

  • Pipeline seguro e repetível para extrair, validar, preencher, dividir, mesclar ou processar PDFs em escala.
  • Transforme PDFs soltos em dados conferíveis, planilhas e fluxos auditáveis.
  • Problema: Equipes perdem horas copiando dados de PDFs, conferindo documentos escaneados e corrigindo erros manuais em planilhas.
  • Fluxo: Automatizar

Exemplo de pedido pronto

Use um PDF simples com uma tabela de vendas em português e gere um CSV preservando cabeçalhos, datas DD/MM/AAAA e valores em R$; informe validações e limitações.

⦿ A receita inteira · aberta

sem cadastro · sem pagar

Esta é uma das skills que a gente deixa aberta pra leitura. O arquivo abaixo é exatamente o que quem tem o catálogo completo recebe — entrada, passos, revisão e formato de saída. Use no seu assistente e adapte ao seu contexto.

---
name: "processamento-avancado-pdfs"
description: "Extrai, valida, preenche e processa PDFs em lote com OCR, tabelas, formulários e cuidados LGPD para documentos brasileiros."
---

# Processamento Avançado de PDFs

Skill para transformar rotinas manuais com PDFs em um processo repetível: identificar o tipo de documento, extrair texto/tabelas, aplicar OCR, preencher formulários, validar arquivos, dividir/mesclar lotes e gerar saídas conferíveis. Use como parte do catálogo Pensaia para automação de documentos e backoffice; não é um produto avulso nem substitui revisão jurídica, fiscal, contábil ou financeira.

## Quando Usar

- Extrair tabelas de relatórios financeiros, boletos, demonstrativos, notas, recibos ou relatórios operacionais para CSV/XLSX.
- Rodar OCR em PDFs digitalizados em português, como comprovantes Pix, documentos administrativos, formulários assinados e acervos escaneados.
- Validar formulários PDF de cadastro de fornecedor, cliente ou colaborador com CNPJ, CPF, CEP, dados bancários e campos obrigatórios.
- Processar lotes: dividir, mesclar, renomear, validar integridade e gerar logs.
- Preparar dados de PDFs para Excel, Google Sheets, Power BI, ERP, auditoria ou conferência humana.

Não usar para declarar validade jurídica, fiscal ou contábil; burlar proteção de arquivos; inventar dados ausentes; ou exportar dados pessoais sem finalidade legítima.

## Resultado Esperado

Um plano ou execução local com: arquivos de saída, logs, erros, validações, campos de baixa confiança e próximos passos. Saídas típicas: CSV, XLSX, JSON, TXT, PDF preenchido, PDF dividido/mesclado, relatório de validação e lista de exceções para revisão.

## Entradas Necessarias

- PDFs ou caminho da pasta de entrada; informar se são textuais, digitalizados ou mistos.
- Objetivo: extrair texto, tabela, OCR, preencher formulário, validar, dividir, mesclar ou processar lote.
- Formato de saída: CSV, XLSX, JSON, TXT ou PDF.
- Regras brasileiras: CPF/CNPJ, CEP, datas DD/MM/AAAA, valores em R$, separador decimal com vírgula, campos obrigatórios.
- Sensibilidade dos dados: contém CPF, CNPJ, endereço, dados bancários, folha, saúde, dados de crianças, contratos ou documentos fiscais?
- Restrições: ambiente local/corporativo, pasta de saída, limite de páginas, necessidade de mascaramento e retenção de arquivos.

## Processo

1. **Triagem**: classifique cada PDF como textual, escaneado, formulário, protegido/corrompido ou imagem ruim. Se houver senha ou bloqueio, peça autorização e não tente burlar proteção.
2. **Backup e segurança**: trabalhe em cópias, nunca sobrescreva originais sem confirmação. Crie pasta `/entrada`, `/saida`, `/logs`, `/erros`.
3. **Escolha do fluxo**:
   - Texto simples: extrair TXT/JSON e preservar páginas/linhas.
   - Tabelas: usar extração tabular, revisar colunas quebradas, totalizadores e valores em R$.
   - OCR: usar Tesseract com idioma `por`; registrar confiança e separar páginas abaixo do limite.
   - Formulários: mapear campos, validar schema JSON, preencher somente campos fornecidos.
   - Lote: processar arquivo por arquivo com log de status, tempo, erro e saída gerada.
4. **Validação antes**: conferir extensão, permissões, tamanho, páginas, criptografia, orientação, qualidade de imagem e duplicidade.
5. **Validação depois**: contar linhas/páginas, comparar totais, verificar colunas obrigatórias, datas, CPF/CNPJ, CEP, moeda, campos vazios e caracteres suspeitos de OCR.
6. **Tratamento de erros**: não parar o lote inteiro por um arquivo; mover exceções para `/erros` com motivo claro.
7. **Revisão humana**: sinalizar campos críticos ou baixa confiança. Para valores financeiros, contratos e documentos fiscais, exigir conferência de responsável.
8. **Entrega**: gerar resumo com arquivos criados, validações, exceções, riscos LGPD e próximos passos.

## Ferramentas E Artefatos

- Softwares: Microsoft Excel, Google Sheets, Google Drive, OneDrive/SharePoint, Adobe Acrobat, VS Code, Power BI.
- Bibliotecas/plataformas: Python, `pdfplumber`, `pypdf`, `pandas`, `pillow`, `pytesseract`, Tesseract OCR com idioma português (`por`).
- Artefatos: PDF, CSV, XLSX, JSON, TXT, schema de formulário, relatório de OCR, log de processamento, relatório de validação.
- Comandos devem ser locais e revisáveis. Se scripts upstream como `extract_tables.py`, `extract_text.py`, `validate_pdf.py`, `split_pdf.py`, `merge_pdfs.py`, `analyze_form.py` ou `fill_form.py` não existirem no ambiente, informe a lacuna em vez de fingir execução.

## Exemplo Brasileiro

**Caso**: escritório contábil recebeu 120 PDFs de relatórios mensais de clientes. Precisa extrair tabelas de faturamento para CSV, mantendo datas `DD/MM/AAAA`, valores `R$ 1.234,56` e CNPJ do cliente parcialmente mascarado.

**Fluxo esperado**:
1. Copiar PDFs para pasta de trabalho e manter originais intactos.
2. Classificar PDFs textuais versus escaneados; OCR apenas nos escaneados.
3. Extrair tabelas com cabeçalhos: cliente, CNPJ mascarado, data, descrição, valor.
4. Validar soma do CSV contra total exibido no PDF quando disponível.
5. Enviar para revisão os arquivos com coluna quebrada, OCR abaixo do limite ou divergência de total.

## Criterios De Qualidade

- Identifica corretamente o fluxo: texto, tabela, OCR, formulário, validação, split/merge ou lote.
- Não inventa campos ausentes nem trata OCR como verdade absoluta.
- Preserva padrões brasileiros: CPF/CNPJ, CEP, R$, datas DD/MM/AAAA e vírgula decimal.
- Gera logs com status por arquivo, sem dados pessoais completos quando não necessários.
- Inclui validação pré e pós-processamento, com lista de exceções.
- Recomenda revisão humana para valores, dados bancários, contratos, documentos fiscais/trabalhistas e baixa confiança.
- Mantém originais protegidos e pede confirmação antes de qualquer ação destrutiva.

## Cuidados, LGPD E Escalacao Humana

- Aplicar minimização: extrair só os campos necessários para a finalidade informada.
- Mascarar CPF/CNPJ, telefones, e-mails, chaves Pix e dados bancários quando a saída completa não for indispensável.
- Evitar logs com dados pessoais completos; preferir identificadores parciais e hash quando fizer sentido.
- Armazenar temporários em pasta controlada e excluir intermediários após validação, conforme política da empresa.
- Escalar ao DPO/responsável LGPD quando houver dados pessoais em massa, dados sensíveis ou finalidade duvidosa.
- Escalar ao jurídico para contratos, procurações, notificações, processos ou interpretação de obrigações.
- Escalar ao financeiro/contábil para divergências em valores, impostos, boletos, Pix, NF-e/NFS-e ou conciliações.
- Proibido: exportar base de dados pessoais para marketing sem base legal; burlar senha; preencher dados inventados; declarar certeza jurídica, médica, fiscal ou financeira.

## Smoke Test

Prompt de teste: "Use um PDF simples com uma tabela de vendas em português e gere um CSV preservando cabeçalhos, datas DD/MM/AAAA e valores em R$; informe validações e limitações."

Passa se a resposta: identifica se o PDF é textual ou escaneado; sugere ferramenta adequada; gera ou descreve CSV; valida linhas, colunas e total; preserva formato brasileiro; não sobrescreve original; menciona LGPD se houver dados pessoais; e sinaliza revisão para campos duvidosos.
ACESSO IMEDIATOACESSO POR E-MAIL · STRIPE BR