AAI News Hub
研究Wed, August 19, 2026·17h ago2 sources corroborating

HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク

このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。

なぜ重要か

今回の結果は、エージェントの安全性がモデルの挙動だけでなく、ハーネスの設定やプロビジョニングの方法にも左右されることを示している。インフラなど高リスクな環境での導入では、ハーネスのアクセス範囲をタスクに必要なものへ絞ることで、不要な露出を減らせる可能性がある。

要点

  • 1.HarnessRiskは、エージェント・ハーネス運用の6つのフェーズを対象としている。
  • 2.テストされた設定全体で、攻撃成功率は12.6%から80.9%の範囲だった。
  • 3.最も脆弱だったフェーズはHarness Configurationだった。

研究者らは、ツール、状態、権限、外部アクションを管理するLLMエージェント・ハーネスの安全性障害を評価するため、ライフサイクル指向のベンチマーク「HarnessRisk」を発表した。このベンチマークは、6つの運用フェーズにまたがる128件のサンドボックス化されたケースを含み、Utility、Attack Success Rate、Persistence、Detectionを測定する。3種類のハーネス、6つの言語モデル、14の設定を対象にした検証では、攻撃成功率は12.6%から80.9%の範囲となり、Utilityは75.0%から97.6%だった。最も脆弱だったフェーズはHarness Configurationだった。

今日から使える

ツールや状態へのアクセスを拡大する前に、エージェント・ハーネスの設定と権限を監査すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究