HarnessOpt-Bench、LLMのハーネス最適化能力を検証
このベンチマークは、LLMがエージェントのプロンプト、ツール、制御フロー、オーケストレーションコードをどれだけ改善できるかを評価する。
なぜ重要か
この研究は、モデルの重みだけでなく、プロンプト、ツール、メモリ、オーケストレーションコードによってエージェント性能を高める取り組みへの関心が高まっていることを示している。共通ベンチマークがあれば、フロンティアLLMやエージェントシステムをまたいで、ハーネス最適化に関する主張をより比較しやすくなる可能性がある。
要点
- 1.HarnessOpt-Benchは、エンドツーエンドのエージェントハーネス最適化を対象にしている。
- 2.スコアは、ホールドアウトテストにおけるシードハーネスからの正規化ゲインを用いる。
- 3.信頼済み実行環境がリソース使用量を計測し、監査証跡を保存する。
研究者らは、エージェント型システムを取り巻くハーネスをLLMがどの程度最適化できるかを測定するベンチマーク、HarnessOpt-Benchを発表した。このプロトコルでは、LLMオプティマイザーがシードとなるハーネス、採点済みの評価フィードバック、固定された評価予算を受け取り、ハーネスを編集したうえで、ホールドアウトされたテスト分割における正規化ゲインで採点される最終候補を提出する。ベンチマークは、評価範囲を強制し、対象エージェントのリソース使用量を計測し、監査のために候補バージョンを保存する信頼済み実行環境を使用する。
⚡ 今日から使える
LLMにエージェントハーネスを最適化させる際は、ホールドアウトテストと厳格な評価境界を用いるべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
arXiv cs.AI+1 outlet·4h ago
研究
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
arXiv cs.AI+1 outlet·4h ago
研究
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。
arXiv cs.AI+1 outlet·4h ago