AAI News Hub
研究Tue, August 4, 2026·Aug 4

研究人员详解面向智能体的 SkillJack 后门风险

这种攻击会把被投毒的智能体经验转化为可持续复用的技能。

为什么重要

这项研究指出了从过往交互中学习的智能体系统面临的一项安全风险:即使原始投毒记录被删除,有害行为仍可能持续存在。这意味着防护重点需要从检索时防御,转向技能提取与生命周期管理的安全性。

核心要点

  • 1.SkillJack 针对的是会从经验中学习可复用技能的智能体。
  • 2.被投毒的历史记录可能变成持久的行为产物。
  • 3.该研究基于 150 条轨迹,在 SkillX 和 Anything2Skill 上进行了评估。

Hugging Face 上的一篇论文介绍了 SkillJack,这是一种针对自我进化型智能体的攻击手法。这类智能体会把交互历史转化为可复用技能。作者表示,该攻击劫持了从经验到技能的流程,使恶意行为成为智能体持久技能库的一部分,而不只是当被投毒的上下文被检索到时才出现。研究团队使用四类策略风险下的 150 条轨迹,在 SkillX 和 Anything2Skill 上评估了该攻击。

今天就能用

审计任何会把历史记录转化为可复用技能的智能体工作流,并在技能持久化之前加入审核或隔离环节。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究