FM-Bench testa agentes em 20 anos de gestão no futebol
O benchmark avalia agentes de LLM em horizontes longos, ao longo de centenas de decisões conectadas.
Por que importa
O benchmark mira uma lacuna na avaliação de agentes: decisões cumulativas em ambientes que reagem ao longo do tempo. Seu formato de confronto direto pode ajudar a comparar o comportamento dos agentes para além de tarefas curtas e delimitadas.
Pontos-chave
- 1.Agentes administram um clube de futebol por 20 anos simulados.
- 2.A pontuação usa um mecanismo determinístico, não um juiz LLM.
- 3.A Arena compara modelos em um único mundo compartilhado de longo horizonte.
O FM-Bench é um novo Football Management Benchmark criado para avaliar se agentes baseados em modelos de linguagem conseguem sustentar a tomada de decisões por longos períodos. No benchmark, um agente de LLM administra um clube de futebol por 20 anos dentro do jogo usando 26 ferramentas em cerca de 340 a 400 pontos de decisão, com resultados pontuados por um mecanismo determinístico, e não por um juiz LLM ou avaliador humano. A configuração relatada inclui uma trilha solo com 15 modelos de ponta contra um mundo roteirizado e uma trilha Arena que coloca modelos e uma âncora roteirizada em um mundo compartilhado de 20 anos.
⚡ Experimente hoje
Leia o paper do FM-Bench antes de usar benchmarks de agentes em tarefas curtas como evidência de capacidade de gestão em horizontes longos.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.