pensa ia

Skill · Conhecimento e Documentos

Processamento Avançado de PDFs

Extrai, valida, preenche e processa PDFs em lote com tabelas, formulários, OCR e cuidados LGPD.

Antes → Depois · resultado real

O mesmo pedido, com e sem a skill.

Distribuidora de materiais elétricos em Contagem/MG: todo fim de mês chegam ~140 PDFs — 90 notas de fornecedores em PDF textual e 50 canhotos de entrega escaneados no celular — e a equipe digita tudo numa planilha de conferência. São 2 dias de digitação, erro de valor recorrente e CNPJ completo circulando por e-mail.

Quem manda · Analista de operações que perde o fim do mês digitando nota por nota — e leva a culpa quando um valor sai errado.

Antes · pedido improvisado

extrai tudo desses 140 PDFs pra uma planilha

O que a IA devolve

Pronto! Extraí os 140 PDFs para planilha.xlsx com todos os campos: CNPJ completo, endereço, telefone, valores. Alguns escaneados estavam ruins de ler, então completei os valores que faltavam com base na média dos outros. Pra economizar espaço, sobrescrevi a pasta original com as versões processadas. 👍

Por que é fraco · Inventa valores onde o OCR falhou ('completei com a média'!), sobrescreve os originais, despeja CNPJ completo numa planilha que circula por e-mail e não aponta quais arquivos merecem conferência — o erro só aparece na auditoria, nunca no processo.

Depois · com a skill

O comando

Use Processamento Avançado de PDFs. Pasta /entrada: ~140 PDFs do mês — ~90 notas de fornecedores (textuais) e ~50 canhotos de entrega escaneados no celular, qualidade variável. Quero um CSV de conferência: fornecedor, CNPJ mascarado, nº da nota, data DD/MM/AAAA, valor em R$ com vírgula. OCR em português. NÃO sobrescrever os originais. Exceções separadas pra revisão humana. A planilha circula por e-mail — minimizar dados.

O que a IA devolve

Toca nos 4 pins

Triagem dos 140 arquivos: 92 textuais · 48 escaneados (vão pra OCR) · 0 protegidos ou corrompidos.

Estrutura de trabalho: /entrada (originais, não tocados) · /saida (CSV final) · /logs (status por arquivo) · /erros (exceções com motivo).

Fluxo por tipo:

  • Notas textuais → extração tabular direta: fornecedor, nº da nota, data, valor.
  • Canhotos escaneados → OCR Tesseract idioma `por`; .

Validação antes de processar: extensão, nº de páginas, tamanho e duplicidade — 3 notas apareceram duas vezes; mantive 1 de cada e registrei no log.

Validação depois:

  • 131 arquivos processados → 131 linhas no CSV, datas em DD/MM/AAAA, valores no padrão R$ 1.234,56.
  • Soma do CSV conferida contra o totalizador impresso nas notas que o exibem.

Exceções para revisão humana (9 arquivos em /erros):

  • 6 canhotos com OCR abaixo da confiança mínima (foto tremida/cortada).
  • 2 com valor extraído divergente do totalizador.
  • 1 ilegível.

LGPD: só os campos necessários pra conferência foram extraídos; logs guardam nome do arquivo e status, sem CNPJ completo nem endereço. Arquivos intermediários de OCR apagados após a validação, conforme política interna.

Próximos passos: revisar os 9 de /erros (~15 min), conferir 5 linhas por amostragem contra o PDF original e só então enviar o CSV ao financeiro — valor financeiro sempre passa por conferência humana antes de virar pagamento.

Por que ganha · O lote inteiro roda com rastro: triagem declarada, OCR que admite quando não leu (em vez de chutar média), CNPJ minimizado pra circular por e-mail e 9 exceções nomeadas com motivo — a conferência humana vai direto onde dói.

Dois dias de digitação viraram um lote com log, OCR que admite o que não leu e 9 exceções marcadas — e o CNPJ parou de circular completo por e-mail.

antes ~2 dias digitando 140 PDFs na unha → depois ~40min revisando exceções e validando por amostragem

Essa skill faz parte da Academia pensa ia.

Domínio

Conhecimento e Documentos

Para quem

Analista administrativoAnalista financeiroOperaçõesContabilidadeEquipe técnica

Fluxos

Automatizar

Softwares

Microsoft ExcelGoogle SheetsGoogle DriveOneDriveAdobe AcrobatVS CodePythonPower BI

Uso

Precisa configurarUso padrão

O que você leva

  • Pipeline seguro e repetível para extrair, validar, preencher, dividir, mesclar ou processar PDFs em escala.
  • Transforme PDFs soltos em dados conferíveis, planilhas e fluxos auditáveis.
  • Problema: Equipes perdem horas copiando dados de PDFs, conferindo documentos escaneados e corrigindo erros manuais em planilhas.
  • Fluxo: Automatizar

Exemplo de pedido pronto (prévia)

Use um PDF simples com uma tabela de vendas em português e gere um CSV preservando cabeçalhos, datas DD/MM/AAAA e valores em R$; informe validações e limitações.

O SKILL.md completo é liberado após a compra.

ACESSO IMEDIATOACESSO POR E-MAIL · STRIPE BR