HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
なぜ重要か
今回の結果は、エージェントの安全性がモデルの挙動だけでなく、ハーネスの設定やプロビジョニングの方法にも左右されることを示している。インフラなど高リスクな環境での導入では、ハーネスのアクセス範囲をタスクに必要なものへ絞ることで、不要な露出を減らせる可能性がある。
要点
- 1.HarnessRiskは、エージェント・ハーネス運用の6つのフェーズを対象としている。
- 2.テストされた設定全体で、攻撃成功率は12.6%から80.9%の範囲だった。
- 3.最も脆弱だったフェーズはHarness Configurationだった。
研究者らは、ツール、状態、権限、外部アクションを管理するLLMエージェント・ハーネスの安全性障害を評価するため、ライフサイクル指向のベンチマーク「HarnessRisk」を発表した。このベンチマークは、6つの運用フェーズにまたがる128件のサンドボックス化されたケースを含み、Utility、Attack Success Rate、Persistence、Detectionを測定する。3種類のハーネス、6つの言語モデル、14の設定を対象にした検証では、攻撃成功率は12.6%から80.9%の範囲となり、Utilityは75.0%から97.6%だった。最も脆弱だったフェーズはHarness Configurationだった。
⚡ 今日から使える
ツールや状態へのアクセスを拡大する前に、エージェント・ハーネスの設定と権限を監査すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AIHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 19, 12:00 PM↗
- arXiv cs.AITask-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure OperationsAug 19, 12:00 PM↗
- HF Daily PapersHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 18, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。
論文、LLMのクロスモデル記憶転移を検証
研究者らは、学習済みの固定メモリをターゲット側リーダーを使って異なるモデル基盤間で移せるかを調べた。