AAI News Hub
研究Fri, August 7, 2026·Aug 72 sources corroborating

HarnessOpt-Bench、LLMのハーネス最適化能力を検証

このベンチマークは、LLMがエージェントのプロンプト、ツール、制御フロー、オーケストレーションコードをどれだけ改善できるかを評価する。

なぜ重要か

この研究は、モデルの重みだけでなく、プロンプト、ツール、メモリ、オーケストレーションコードによってエージェント性能を高める取り組みへの関心が高まっていることを示している。共通ベンチマークがあれば、フロンティアLLMやエージェントシステムをまたいで、ハーネス最適化に関する主張をより比較しやすくなる可能性がある。

要点

  • 1.HarnessOpt-Benchは、エンドツーエンドのエージェントハーネス最適化を対象にしている。
  • 2.スコアは、ホールドアウトテストにおけるシードハーネスからの正規化ゲインを用いる。
  • 3.信頼済み実行環境がリソース使用量を計測し、監査証跡を保存する。

研究者らは、エージェント型システムを取り巻くハーネスをLLMがどの程度最適化できるかを測定するベンチマーク、HarnessOpt-Benchを発表した。このプロトコルでは、LLMオプティマイザーがシードとなるハーネス、採点済みの評価フィードバック、固定された評価予算を受け取り、ハーネスを編集したうえで、ホールドアウトされたテスト分割における正規化ゲインで採点される最終候補を提出する。ベンチマークは、評価範囲を強制し、対象エージェントのリソース使用量を計測し、監査のために候補バージョンを保存する信頼済み実行環境を使用する。

今日から使える

LLMにエージェントハーネスを最適化させる際は、ホールドアウトテストと厳格な評価境界を用いるべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究