HarnessEval-W adiciona testes baseados em agentes para modelos de mundo
O pipeline de benchmark usa subagentes para avaliar rollouts com cadeias de raciocínio inspecionáveis.
Por que importa
A avaliação de modelos de mundo muitas vezes depende de saber se os rollouts gerados preservam física, causalidade e estado do mundo, mas métricas padrão podem obscurecer por que uma pontuação foi atribuída. O HarnessEval-W busca tornar esses julgamentos mais transparentes e auditáveis.
Pontos-chave
- 1.Pipeline agentificado decompõe avaliações de modelos de mundo em subproblemas.
- 2.Subagentes produzem evidências para julgamentos sobre física, causalidade e estado.
- 3.Autores aplicaram o HarnessEval-W a 18 modelos de mundo representativos.
Pesquisadores apresentaram o HarnessEval-W, um pipeline de avaliação agentificado para benchmark de modelos de mundo visuais. Em vez de aplicar apenas métricas fixas, o sistema interpreta cada caso de avaliação, decompõe perguntas em subproblemas mensuráveis, atribui subagentes especializados com contexto relevante e ferramentas de diagnóstico, e produz um veredito final com uma árvore de evidências. Os autores aplicaram a abordagem a 18 modelos de mundo representativos.
⚡ Experimente hoje
Leia o paper do HarnessEval-W antes de confiar apenas em métricas escalares para avaliar modelos de mundo visuais.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Negócios
Perplexity ganha milhões de usuários na Índia
Uma oferta gratuita da Airtel impulsionou a base de usuários da Perplexity na Índia, com a receita subindo após o fim das novas inscrições.
TRACE-Bench mira a geração de imagens com múltiplas referências
O benchmark decompõe prompts em quatro operadores para diagnosticar falhas dos modelos.
Flow Motion Policy: planejamento de movimento de manipuladores com modelos de Flow Matching
arXiv:2604.