DiSCO、ブラックボックス型text-to-imageの安全性に照準
arXiv論文は、モデルへのアクセスなしにNSFW出力を減らすプロンプトレベルの最適化を提案している。
なぜ重要か
既存の安全対策の多くはモデル内部へのアクセスを前提としており、独自仕様の画像生成モデルでは利用が限られる。厳密なブラックボックス手法は、論文で報告された設定を超えて検証されれば、クローズドなシステムとオープンなシステムの双方に安全介入を適用しやすくする可能性がある。
要点
- 1.DiSCOは再学習やモデル内部情報なしに、プロンプトレベルで機能する。
- 2.この手法は、無害なプロンプトがNSFW生成を引き起こす問題に対処する。
- 3.ターゲットモデルの画像プールを使い、より安全なプロンプトのサフィックスを導く。
研究者らは、text-to-imageシステム向けのゼロショット防御手法「DiSCO」を発表した。これは完全にプロンプトレベルで機能する。言語的には安全なプロンプトでも、モデルが学習した分布の影響で有害な出力が生成されるケースを対象に、サフィックス拡張、ビームサーチ、安全・危険な画像プールを用いた対照スコアリング、ターゲットモデルからの反復的フィードバックを組み合わせる。
⚡ 今日から使える
text-to-imageの安全フィルターでLLMだけに頼ったプロンプト書き換えを採用する前に、論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
arXiv cs.AI+1 outlet·8h ago
研究
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。
arXiv cs.AI+1 outlet·8h ago
研究
論文、LLMのクロスモデル記憶転移を検証
研究者らは、学習済みの固定メモリをターゲット側リーダーを使って異なるモデル基盤間で移せるかを調べた。
arXiv cs.AI+1 outlet·8h ago