HarnessOpt-Bench 测试 LLM 的智能体外壳优化能力
该基准评估 LLM 如何改进智能体提示词、工具、控制流和编排代码。
为什么重要
这项工作反映出业界越来越关注通过提示词、工具、记忆和编排代码提升智能体性能,而不只是依赖模型权重本身。一个通用基准可以让不同前沿 LLM 和智能体系统关于外壳优化的主张更具可比性。
核心要点
- 1.HarnessOpt-Bench 面向端到端智能体外壳优化。
- 2.评分基于留出测试中相对种子外壳的归一化增益。
- 3.可信执行环境会计量资源使用并保留审计轨迹。
研究人员推出了 HarnessOpt-Bench,用于衡量 LLM 优化智能体系统外围“外壳”的能力。在这一协议中,作为优化器的 LLM 会接收一个种子外壳、带评分的评估反馈以及固定的评估预算,对外壳进行编辑,并提交最终候选方案;其得分依据是在留出测试分区上相对种子外壳取得的归一化增益。该基准使用可信执行环境来强制执行评估边界、计量目标智能体的资源使用,并保留候选版本以供审计。
⚡ 今天就能用
让 LLM 优化智能体外壳时,应使用留出测试并设置严格的评估边界。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.CLHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 7, 12:00 PM↗
- arXiv cs.LGEvolveNet: Collaborative Harness Evolution for Agent Self-ImprovementAug 6, 12:00 PM↗
- HF Daily PapersHarnessOpt-Bench: Evaluating LLMs at Harness OptimizationAug 6, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。