FM-Bench pone a prueba agentes en 20 años de gestión futbolística
El benchmark evalúa agentes LLM de largo horizonte a través de cientos de decisiones conectadas.
Por qué importa
El benchmark apunta a una brecha en la evaluación de agentes: decisiones acumulativas en entornos que responden con el tiempo. Su formato de enfrentamiento directo puede ayudar a comparar el comportamiento de los agentes más allá de tareas breves y delimitadas.
Puntos clave
- 1.Los agentes gestionan un club de fútbol durante 20 años simulados.
- 2.La puntuación usa un motor determinista, no un juez LLM.
- 3.Arena compara modelos en un único mundo compartido de largo horizonte.
FM-Bench es un nuevo Football Management Benchmark diseñado para evaluar si los agentes basados en modelos de lenguaje pueden sostener la toma de decisiones a largo plazo. En el benchmark, un agente LLM dirige un club de fútbol durante 20 años dentro del juego usando 26 herramientas en aproximadamente 340 a 400 puntos de decisión, con resultados puntuados por un motor determinista en lugar de un juez LLM o un evaluador humano. La configuración reportada incluye una pista individual con 15 modelos de frontera frente a un mundo guionizado y una pista Arena que sitúa modelos y un referente guionizado en un mundo compartido de 20 años.
⚡ Pruébalo hoy
Lee el paper de FM-Bench antes de usar benchmarks de agentes basados en tareas cortas como evidencia de capacidad de gestión a largo plazo.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.