AAI News Hub
ForschungWed, August 19, 2026·1d ago2 sources corroborating

FM-Bench testet Agenten über 20 Jahre Fußballmanagement

Der Benchmark bewertet LLM-Agenten mit langfristigem Horizont anhand Hunderter miteinander verknüpfter Entscheidungen.

Warum es wichtig ist

Der Benchmark zielt auf eine Lücke in der Agentenbewertung: kumulative Entscheidungen in Umgebungen, die sich im Zeitverlauf verändern. Sein Head-to-Head-Format könnte helfen, Agentenverhalten über kurze, eng begrenzte Aufgaben hinaus zu vergleichen.

Die Kernpunkte

  • 1.Agenten führen einen Fußballverein über 20 simulierte Jahre.
  • 2.Die Bewertung erfolgt über eine deterministische Engine, nicht über einen LLM-Judge.
  • 3.Die Arena vergleicht Modelle in einer gemeinsamen langfristigen Welt.

FM-Bench ist ein neuer Football Management Benchmark, der prüft, ob Sprachmodell-Agenten Entscheidungsprozesse über lange Zeiträume hinweg durchhalten können. In dem Benchmark führt ein LLM-Agent einen Fußballverein über 20 Spieljahre hinweg und nutzt dabei 26 Tools an rund 340 bis 400 Entscheidungspunkten. Die Ergebnisse werden von einer deterministischen Engine bewertet, nicht von einem LLM-Judge oder menschlichen Ratern. Der beschriebene Aufbau umfasst einen Solo-Track mit 15 Frontier-Modellen gegen eine geskriptete Welt sowie einen Arena-Track, in dem Modelle und ein geskripteter Anker in einer gemeinsamen 20-Jahres-Welt antreten.

Heute ausprobieren

Lesen Sie das FM-Bench-Paper, bevor Sie Kurzaufgaben-Benchmarks für Agenten als Beleg für langfristige Managementfähigkeit heranziehen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung