FM-Bench testet Agenten über 20 Jahre Fußballmanagement
Der Benchmark bewertet LLM-Agenten mit langfristigem Horizont anhand Hunderter miteinander verknüpfter Entscheidungen.
Warum es wichtig ist
Der Benchmark zielt auf eine Lücke in der Agentenbewertung: kumulative Entscheidungen in Umgebungen, die sich im Zeitverlauf verändern. Sein Head-to-Head-Format könnte helfen, Agentenverhalten über kurze, eng begrenzte Aufgaben hinaus zu vergleichen.
Die Kernpunkte
- 1.Agenten führen einen Fußballverein über 20 simulierte Jahre.
- 2.Die Bewertung erfolgt über eine deterministische Engine, nicht über einen LLM-Judge.
- 3.Die Arena vergleicht Modelle in einer gemeinsamen langfristigen Welt.
FM-Bench ist ein neuer Football Management Benchmark, der prüft, ob Sprachmodell-Agenten Entscheidungsprozesse über lange Zeiträume hinweg durchhalten können. In dem Benchmark führt ein LLM-Agent einen Fußballverein über 20 Spieljahre hinweg und nutzt dabei 26 Tools an rund 340 bis 400 Entscheidungspunkten. Die Ergebnisse werden von einer deterministischen Engine bewertet, nicht von einem LLM-Judge oder menschlichen Ratern. Der beschriebene Aufbau umfasst einen Solo-Track mit 15 Frontier-Modellen gegen eine geskriptete Welt sowie einen Arena-Track, in dem Modelle und ein geskripteter Anker in einer gemeinsamen 20-Jahres-Welt antreten.
⚡ Heute ausprobieren
Lesen Sie das FM-Bench-Paper, bevor Sie Kurzaufgaben-Benchmarks für Agenten als Beleg für langfristige Managementfähigkeit heranziehen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.