AAI News Hub
研究Wed, August 19, 2026·18h ago2 家媒体交叉佐证

HarnessRisk 基准测试 agent harness 的安全失效

该基准在 agent harness 的各个阶段测试攻击,同时相关研究关注面向特定任务的资源配置。

为什么重要

这些发现表明,agent 安全不仅取决于模型行为,也取决于 harness 的配置和资源供给方式。对于基础设施和其他高风险部署,将 harness 的访问范围限制在任务所需范围内,可能有助于减少不必要的暴露面。

核心要点

  • 1.HarnessRisk 覆盖 agent harness 运行的六个阶段。
  • 2.在测试配置中,攻击成功率从 12.6% 到 80.9% 不等。
  • 3.Harness Configuration 是最脆弱的阶段。

研究人员推出了 HarnessRisk,这是一个面向生命周期的基准,用于评估 LLM agent harness 在管理工具、状态、权限和外部操作时出现的安全失效。该基准包含 128 个沙箱化案例,覆盖六个运行阶段,并衡量 Utility、Attack Success Rate、Persistence 和 Detection。跨三种 harness、六个语言模型和 14 种配置的测试显示,攻击成功率从 12.6% 到 80.9% 不等,而 Utility 介于 75.0% 和 97.6% 之间;Harness Configuration 是最脆弱的阶段。

今天就能用

在扩大工具或状态访问权限之前,先审计 agent harness 的配置和权限。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究