FM-Bench 测试智能体 20 年足球俱乐部管理能力
该基准通过数百个相互关联的决策,评估长周期 LLM 智能体。
为什么重要
该基准瞄准了智能体评估中的一个缺口:在会随时间响应的环境中考察累积决策。其正面对抗格式或许有助于比较智能体在短周期、有边界任务之外的行为表现。
核心要点
- 1.智能体管理一家足球俱乐部,模拟周期为 20 年。
- 2.评分使用确定性引擎,而不是 LLM 裁判。
- 3.Arena 在同一个共享的长周期世界中比较各个模型。
FM-Bench 是一个新的足球管理基准,用于评估语言模型智能体能否在长时间跨度内持续做出决策。在该基准中,一个 LLM 智能体会使用 26 种工具,在约 340 到 400 个决策点上运营一家足球俱乐部 20 个游戏年;结果由确定性引擎评分,而不是由 LLM 裁判或人工评审打分。报告中的设置包括一条单独赛道,让 15 个前沿模型在脚本化世界中运行;以及一条 Arena 赛道,将多个模型和一个脚本化锚点放入同一个 20 年世界中比较。
⚡ 今天就能用
在把短任务智能体基准作为长周期管理能力证据之前,先阅读 FM-Bench 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。