AAI News Hub
研究Fri, August 21, 2026·3h ago2 sources corroborating

AI4AI-Bench、エージェントの訓練アルゴリズム設計能力を検証

arXivの新ベンチマークは、LLMエージェントが凍結されたリポジトリ群で訓練アルゴリズムを書き換えられるかを評価する。

なぜ重要か

この研究は、訓練の実行方法への変更と、モデルの学習方法そのものへの変更を切り分けることで、エージェント評価の空白に取り組んでいる。同時に、重みレベルでの能力向上を伴わない持続的な研究状態の改善を、再帰的自己改善と呼べるのかという未解決の用語上の問題も浮き彫りにしている。

要点

  • 1.ベンチマークは、10の凍結済みリポジトリと訓練アルゴリズム系統を対象とする。
  • 2.エージェントは4時間でアルゴリズムを書き換え、その後、隠された評価を受ける。
  • 3.この設定は、モデルの重みレベルでの自己改善を示すものではない。

arXivに投稿された新論文が、LLMエージェントがより優れた訓練アルゴリズムを設計できるかを検証するベンチマーク「AI4AI-Bench」を紹介した。著者らはこの能力を、再帰的自己改善の中核に位置づけている。ベンチマークは、10種類の訓練アルゴリズム系統にまたがる10の凍結済み研究リポジトリを対象とする。各タスクでは、エージェントが1台のB300上で4時間かけて訓練アルゴリズムを書き換え、その後コードをゼロから再実行し、最大12時間かけて、隠された固定評価器が元のアルゴリズムと比較して採点する。Redditでの議論では、基盤モデルと評価器が固定されたままで、モデルが自らの重みを変更するわけではないため、この設定は再帰的自己改善をより狭く定義していると指摘されている。

今日から使える

AI4AI-Benchの結果を、重みレベルの再帰的自己改善の証拠として扱う前に、まず同論文を読むべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究