AAI News Hub
研究Tue, August 18, 2026·2d ago

研究测试 DeepSeek Harness 抵御提示注入的能力

HF Daily Papers 摘要称,研究在 16 个间接内容渠道中进行了 14,560 次受控执行。

为什么重要

结果显示,当不受信任的内容进入工具结果、附加上下文或工具调用策略路径时,代理系统仍可能存在漏洞。论文指出,需要在不受信任内容与敏感操作之间设置控制措施。

核心要点

  • 1.14,560 次执行测试了 DeepSeek Harness 对提示注入的抵抗能力。
  • 2.文件模式下隐藏 Unicode 攻击成功率达到 25.5%。
  • 3.控制措施应将不受信任内容与敏感操作隔离开来。

一项安全评估使用 AI-Infra-Guard 构建测试、传递受控污染内容、执行 DeepSeek Harness、收集追踪记录并判定结果,以评估 DeepSeek Harness 中的间接提示注入风险。研究覆盖了 16 个间接内容渠道、文本和文件两种载体模式、35 个载荷目标、一个未修改基线以及 12 种攻击方法,共进行了 14,560 次受控执行。观察到的最高攻击成功率分别为:文本模式下假完成攻击 17.0%,文件模式下隐藏 Unicode 攻击 25.5%,以及文件模式下 skills 渠道攻击 16.0%。

今天就能用

审计代理工作流,检查不受信任的文本或文件是否会流向敏感工具调用,尤其要关注隐藏 Unicode 和 skills 渠道输入。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究