AAI News Hub
研究Wed, August 19, 2026·8h ago2 sources corroborating

DiSCO、ブラックボックス型text-to-imageの安全性に照準

arXiv論文は、モデルへのアクセスなしにNSFW出力を減らすプロンプトレベルの最適化を提案している。

なぜ重要か

既存の安全対策の多くはモデル内部へのアクセスを前提としており、独自仕様の画像生成モデルでは利用が限られる。厳密なブラックボックス手法は、論文で報告された設定を超えて検証されれば、クローズドなシステムとオープンなシステムの双方に安全介入を適用しやすくする可能性がある。

要点

  • 1.DiSCOは再学習やモデル内部情報なしに、プロンプトレベルで機能する。
  • 2.この手法は、無害なプロンプトがNSFW生成を引き起こす問題に対処する。
  • 3.ターゲットモデルの画像プールを使い、より安全なプロンプトのサフィックスを導く。

研究者らは、text-to-imageシステム向けのゼロショット防御手法「DiSCO」を発表した。これは完全にプロンプトレベルで機能する。言語的には安全なプロンプトでも、モデルが学習した分布の影響で有害な出力が生成されるケースを対象に、サフィックス拡張、ビームサーチ、安全・危険な画像プールを用いた対照スコアリング、ターゲットモデルからの反復的フィードバックを組み合わせる。

今日から使える

text-to-imageの安全フィルターでLLMだけに頼ったプロンプト書き換えを採用する前に、論文を読むべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究