AAI News Hub
NegóciosMon, August 17, 2026·2d ago

HarnessEval-W adiciona testes baseados em agentes para modelos de mundo

O pipeline de benchmark usa subagentes para avaliar rollouts com cadeias de raciocínio inspecionáveis.

Por que importa

A avaliação de modelos de mundo muitas vezes depende de saber se os rollouts gerados preservam física, causalidade e estado do mundo, mas métricas padrão podem obscurecer por que uma pontuação foi atribuída. O HarnessEval-W busca tornar esses julgamentos mais transparentes e auditáveis.

Pontos-chave

  • 1.Pipeline agentificado decompõe avaliações de modelos de mundo em subproblemas.
  • 2.Subagentes produzem evidências para julgamentos sobre física, causalidade e estado.
  • 3.Autores aplicaram o HarnessEval-W a 18 modelos de mundo representativos.

Pesquisadores apresentaram o HarnessEval-W, um pipeline de avaliação agentificado para benchmark de modelos de mundo visuais. Em vez de aplicar apenas métricas fixas, o sistema interpreta cada caso de avaliação, decompõe perguntas em subproblemas mensuráveis, atribui subagentes especializados com contexto relevante e ferramentas de diagnóstico, e produz um veredito final com uma árvore de evidências. Os autores aplicaram a abordagem a 18 modelos de mundo representativos.

Experimente hoje

Leia o paper do HarnessEval-W antes de confiar apenas em métricas escalares para avaliar modelos de mundo visuais.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Negócios