HarnessRisk 基准测试 agent harness 的安全失效
该基准在 agent harness 的各个阶段测试攻击,同时相关研究关注面向特定任务的资源配置。
为什么重要
这些发现表明,agent 安全不仅取决于模型行为,也取决于 harness 的配置和资源供给方式。对于基础设施和其他高风险部署,将 harness 的访问范围限制在任务所需范围内,可能有助于减少不必要的暴露面。
核心要点
- 1.HarnessRisk 覆盖 agent harness 运行的六个阶段。
- 2.在测试配置中,攻击成功率从 12.6% 到 80.9% 不等。
- 3.Harness Configuration 是最脆弱的阶段。
研究人员推出了 HarnessRisk,这是一个面向生命周期的基准,用于评估 LLM agent harness 在管理工具、状态、权限和外部操作时出现的安全失效。该基准包含 128 个沙箱化案例,覆盖六个运行阶段,并衡量 Utility、Attack Success Rate、Persistence 和 Detection。跨三种 harness、六个语言模型和 14 种配置的测试显示,攻击成功率从 12.6% 到 80.9% 不等,而 Utility 介于 75.0% 和 97.6% 之间;Harness Configuration 是最脆弱的阶段。
⚡ 今天就能用
在扩大工具或状态访问权限之前,先审计 agent harness 的配置和权限。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 19, 12:00 PM↗
- arXiv cs.AITask-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure OperationsAug 19, 12:00 PM↗
- HF Daily PapersHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 18, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。