AAI News Hub
研究Fri, August 7, 2026·Aug 72 家媒体交叉佐证

研究人员推出面向 LLM 智能体的 HarnessOpt-Bench

该基准测试在固定评估预算下,检验 LLM 改进智能体 harness 的能力。

为什么重要

这项工作将评估重点从模型权重本身,扩展到影响智能体表现的提示词、工具、控制流、记忆与编排代码。它提供了一套通用协议,用于衡量前沿 LLM 能否在现实的评估约束下,通过修改 harness 来改进智能体系统。

核心要点

  • 1.HarnessOpt-Bench 评估 LLM 智能体的端到端 harness 优化能力。
  • 2.评分基于留出测试中相较初始 harness 的归一化增益。
  • 3.该基准包含用于审计和资源计量的执行控制。

研究人员推出了 HarnessOpt-Bench,这是一个用于评估基于 LLM 的智能体系统中自动化 harness 优化能力的基准。在这一设置中,LLM 优化器会接收目标智能体的初始 harness、评分后的评估反馈以及固定评估预算,随后修改该 harness,并提交最终候选版本。候选版本会在留出的测试分区上,与初始版本相比按归一化增益计分;可信执行环境则负责执行评估边界、计量资源使用,并保留版本以供审计。

今天就能用

在尝试自动化提示词、工具或智能体编排优化时,应使用留出测试集并进行资源计量。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究