研究者ら、LLMエージェント向けHarnessOpt-Benchを発表
このベンチマークは、固定された評価予算の下でLLMがエージェントのハーネスをどれだけ改善できるかを検証する。
なぜ重要か
この研究は、評価の焦点をモデルの重みだけでなく、エージェント性能を左右するプロンプト、ツール、制御フロー、メモリ、オーケストレーションコードへと広げるものだ。現実的な評価制約の下で、フロンティアLLMがハーネス変更を通じてエージェントシステムを改善できるかを測る共通プロトコルを提供する。
要点
- 1.HarnessOpt-Benchは、LLMエージェントのエンドツーエンドのハーネス最適化を評価する。
- 2.採点には、ホールドアウトテスト上で初期ハーネスに対する正規化ゲインを用いる。
- 3.このベンチマークには、監査とリソース計測のための実行制御が含まれる。
研究者らは、LLMベースのエージェントシステムにおける自動ハーネス最適化を評価するベンチマーク、HarnessOpt-Benchを発表した。この設定では、LLMオプティマイザーが対象エージェントの初期ハーネス、採点済みの評価フィードバック、固定された評価予算を受け取り、ハーネスを編集して最終候補を提出する。候補は、ホールドアウトされたテスト分割で初期ハーネスに対してどれだけ正規化ゲインを得たかで採点され、信頼できる実行環境が評価範囲を強制し、リソース使用量を計測し、監査用にバージョンを保持する。
⚡ 今日から使える
自動化されたプロンプト、ツール、エージェント・オーケストレーションの最適化を試す際は、ホールドアウトテストとリソース計測を用いるべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
- arXiv cs.AIWeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent NetworksAug 5, 12:00 PM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
arXiv cs.AI+1 outlet·5h ago
研究
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
arXiv cs.AI+1 outlet·5h ago
研究
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。
arXiv cs.AI+1 outlet·5h ago