AAI News Hub
研究Thu, August 6, 2026·Aug 62 sources corroborating

CalibForge、ソルバーの挙動をもとにターミナル課題を較正

このシステムは5,431件の課題を生成し、ターミナルおよびコーディングのベンチマークでエージェントのスコアを向上させた。

なぜ重要か

この研究は、ターミナルエージェントの訓練における中核的なボトルネック、すなわち実行可能で検証でき、学習に適した難度を持つ課題を作ることに取り組んでいる。Terminal-Bench 2.0、SWE-bench Pro、Doc2Repoで報告された性能向上は、ソルバーに相対化した課題較正が、検証だけに頼る場合を超えて教師信号を改善し得ることを示している。

要点

  • 1.CalibForgeは5,431件の較正済みターミナル課題を生成した。
  • 2.このアプローチはソルバーの挙動を使って課題の難度を修正する。
  • 3.Doc2Repoでは最大30.04ポイントの改善が報告された。

研究者らは、検証済みのソルバー挙動を用いてターミナルエージェント向けの訓練課題を合成する自律システム、CalibForgeを発表した。この手法は、複数ソルバー間の不一致や、強いソルバーは通過し弱いソルバーは失敗するという対比的較正を含む、敵対的なソルバー較正を通じて候補課題を修正する。CalibForgeは5,431件の較正済みターミナル課題を生成し、そのコレクションで訓練されたモデルはTerminal-Bench 2.0で32.58%と47.57%に到達した。

今日から使える

ターミナルエージェントの訓練データを設計する前、または実行可能な検証だけに頼る前に、CalibForgeの論文を確認したい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究