研究者ら、エージェントを狙うバックドア攻撃「SkillJack」を公表
汚染されたエージェントの経験を、永続的に再利用されるスキルへと変える攻撃だ。
なぜ重要か
この研究は、過去のやり取りから永続的な能力を学習するエージェントに特有のセキュリティリスクを示している。悪意ある挙動がすでに再利用可能なスキルへ昇格している場合、汚染された元記録を削除するだけでは不十分な可能性がある。
要点
- 1.SkillJackは、自己進化型エージェントにおける経験からスキルへの変換パイプラインを標的にする。
- 2.元の汚染記録が削除された後も、悪意ある挙動が残り続ける可能性がある。
- 3.論文はSkillXとAnything2Skill上でこの攻撃を評価している。
Hugging Face Daily Papersに掲載された論文が、対話履歴を再利用可能なスキルへ変換する自己進化型エージェントへの攻撃「SkillJack」を紹介している。著者らによると、この攻撃は実行時に汚染されたコンテキストが検索されることに依存するのではなく、経験からスキルを生成するパイプラインを乗っ取り、エージェントの永続的なスキル群に悪意ある挙動を埋め込む。論文では、サニタイズによる隠蔽、クロスレイヤーでの昇格と永続性の分離という3つの性質を示し、4つのポリシーリスク分類にまたがる150件の軌跡を用いて、SkillXとAnything2Skill上で攻撃を評価している。
⚡ 今日から使える
自己進化型エージェントのパイプラインでは、検索時の汚染だけでなく、経験がどのように永続的なスキルへ変換されるかも監査すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·13h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·13h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·19h ago