pensa ia

Skill · Dados e BI

Curadoria de Dados para Treino de LLM com NeMo Curator

Planeja e documenta pipelines de curadoria de grandes datasets para IA, com filtros pt-BR, deduplicação, mascaramento de dados pessoais e validação humana.

Domínio

Dados e BI

Para quem

ML EngineerEngenheiro de DadosCientista de DadosArquiteto de IADPO técnico

Fluxos

Transformar

Softwares

NVIDIA NeMo CuratorPythonRAPIDS/cuDFDaskCUDADockerVS CodeJupyter

Uso

AvançadoUso intensivo

O que você leva

  • Pipeline técnico documentado para curadoria de dataset em JSONL/Parquet/CSV, com critérios de qualidade, deduplicação, mascaramento e validações.
  • Transforma corpus bruto em um plano de curadoria auditável antes de usar dados no treino ou ajuste de modelos de IA.
  • Problema: O time tem um volume grande de textos ou mídia coletados de atendimento, web ou bases internas e precisa limpar, deduplicar e reduzir riscos de privacidade antes de treinar ou ajustar modelos.
  • Fluxo: Transformar

Exemplo de pedido pronto (prévia)

Tenho um JSONL pequeno com campos id e text em português, contendo duplicatas, textos curtos, telefone, e-mail e CPF fictício. Gere um pipeline mínimo de curadoria com filtros, deduplicação e mascaramento, explicando o que validar antes de rodar em produção.

O SKILL.md completo é liberado após a compra.

ACESSO IMEDIATOACESSO POR E-MAIL · STRIPE BR