Benchmark GDPevo testa a autoevolução de agentes
O benchmark usa tarefas de fluxos de trabalho corporativos para medir se agentes melhoram com experiências anteriores.
Por que importa
O trabalho mira uma lacuna central na avaliação de agentes de IA: saber se ganhos de desempenho podem ser atribuídos a experiências reutilizáveis, em vez de contaminação ou artefatos do benchmark. Seu pipeline automatizado foi projetado para ampliar a suíte e reduzir o risco de contaminação.
Pontos-chave
- 1.Testa ganhos de agentes a partir de experiências anteriores
- 2.Cobre fluxos de trabalho de CRM, ERP, finanças, saúde e jurídico
- 3.A V1 inclui 120 tarefas em 12 grupos
Pesquisadores apresentaram o GDPevo, um benchmark para avaliar a autoevolução de agentes em fluxos de trabalho corporativos relacionados ao PIB. O benchmark usa hibridização de regras para dividir fluxos de trabalho em regras de negócio atômicas, distribuí-las entre tarefas de treinamento e recombiná-las em tarefas de teste reservadas. O GDPevo abrange fluxos de trabalho de CRM, ERP, finanças, saúde, jurídico e dados, com uma versão V1 de 120 tarefas em 12 grupos.
⚡ Experimente hoje
Analise o GDPevo antes de afirmar que um agente melhora com memória persistente ou experiência em tarefas anteriores.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google DeepMind apresenta modelo de tradução de língua de sinais para texto
O SL2T da DeepMind impulsiona novos recursos de língua de sinais para pessoas surdas e com deficiência auditiva.
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.