DeepSeek Harnessのプロンプトインジェクション耐性を検証
HF Daily Papersの要約によると、16の間接コンテンツチャネルで14,560件の制御実行を実施。
なぜ重要か
結果は、信頼できないコンテンツがツール結果、追加コンテキスト、またはツール呼び出しポリシーの経路に到達すると、エージェントシステムが脆弱なままであり得ることを示している。論文は、信頼できないコンテンツと機微なアクションの間に制御を設ける必要性を指摘している。
要点
- 1.DeepSeek Harnessのプロンプトインジェクション耐性について14,560件の実行で検証した。
- 2.ファイルモードの隠しUnicodeは攻撃成功率25.5%に達した。
- 3.制御により、信頼できないコンテンツを機微なアクションから切り離すべきだ。
あるセキュリティ評価では、AI-Infra-Guardを用いてテストを構築し、制御された汚染データを投入、ハーネスを実行してトレースを収集し、結果を判定する形で、DeepSeek Harnessにおける間接プロンプトインジェクションを検証した。調査は、16の間接コンテンツチャネル、テキストおよびファイルのキャリアモード、35のペイロード目的、未改変のベースライン1件、攻撃手法12種にまたがる14,560件の制御実行を対象とした。観測された攻撃成功率の最大値は、テキストモードの偽完了攻撃で17.0%、ファイルモードの隠しUnicodeで25.5%、ファイルモードのskillsチャネルで16.0%だった。
⚡ 今日から使える
隠しUnicodeやskillsチャネル入力を中心に、信頼できないテキストやファイルが機微なツール呼び出しに到達していないか、エージェントのワークフローを監査すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。