FM-Bench、20年にわたるサッカークラブ運営でエージェントを検証
このベンチマークは、数百の連動する意思決定を通じて、長期運用におけるLLMエージェントを評価する。
なぜ重要か
このベンチマークは、時間とともに反応する環境における累積的な意思決定という、エージェント評価の空白を狙っている。直接対決型の形式により、短く区切られたタスクを超えてエージェントの振る舞いを比較しやすくなる可能性がある。
要点
- 1.エージェントは20年分のシミュレーションでサッカークラブを運営する。
- 2.採点にはLLM審査員ではなく、決定論的なエンジンを使う。
- 3.Arenaでは、単一の共有された長期世界の中でモデル同士を比較する。
FM-Benchは、言語モデルエージェントが長期にわたって意思決定を維持できるかを評価するための新しいFootball Management Benchmarkだ。このベンチマークでは、LLMエージェントが26種類のツールを使い、約340〜400の意思決定ポイントを経ながら、ゲーム内で20年間にわたりサッカークラブを運営する。結果はLLM審査員や人間の評価者ではなく、決定論的なエンジンによって採点される。報告されている設定には、15のフロンティアモデルがスクリプト化された世界を相手にするソロトラックと、複数のモデルおよびスクリプト化された基準エージェントを同じ20年の世界に配置するArenaトラックが含まれる。
⚡ 今日から使える
短期タスクのエージェントベンチマークを長期的な管理能力の証拠として使う前に、FM-Benchの論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。