AAI News Hub
研究Fri, August 7, 2026·Aug 72 sources corroborating

研究者ら、LLMエージェント向けHarnessOpt-Benchを発表

このベンチマークは、固定された評価予算の下でLLMがエージェントのハーネスをどれだけ改善できるかを検証する。

なぜ重要か

この研究は、評価の焦点をモデルの重みだけでなく、エージェント性能を左右するプロンプト、ツール、制御フロー、メモリ、オーケストレーションコードへと広げるものだ。現実的な評価制約の下で、フロンティアLLMがハーネス変更を通じてエージェントシステムを改善できるかを測る共通プロトコルを提供する。

要点

  • 1.HarnessOpt-Benchは、LLMエージェントのエンドツーエンドのハーネス最適化を評価する。
  • 2.採点には、ホールドアウトテスト上で初期ハーネスに対する正規化ゲインを用いる。
  • 3.このベンチマークには、監査とリソース計測のための実行制御が含まれる。

研究者らは、LLMベースのエージェントシステムにおける自動ハーネス最適化を評価するベンチマーク、HarnessOpt-Benchを発表した。この設定では、LLMオプティマイザーが対象エージェントの初期ハーネス、採点済みの評価フィードバック、固定された評価予算を受け取り、ハーネスを編集して最終候補を提出する。候補は、ホールドアウトされたテスト分割で初期ハーネスに対してどれだけ正規化ゲインを得たかで採点され、信頼できる実行環境が評価範囲を強制し、リソース使用量を計測し、監査用にバージョンを保持する。

今日から使える

自動化されたプロンプト、ツール、エージェント・オーケストレーションの最適化を試す際は、ホールドアウトテストとリソース計測を用いるべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究