DiSCO 瞄准黑盒文生图安全问题
这篇 arXiv 论文提出在提示词层面进行优化,以在无法访问模型的情况下减少 NSFW 输出。
为什么重要
许多现有安全防御都假定可以访问模型内部机制,这限制了它们在专有图像生成器上的应用。如果能在论文所报告的实验环境之外得到验证,严格的黑盒方法可能让安全干预更容易应用于封闭和开放系统。
核心要点
- 1.DiSCO 在提示词层面工作,无需重新训练,也无需访问模型内部机制。
- 2.该方法处理的是看似无害却仍会触发 NSFW 生成的提示词。
- 3.它使用目标模型的图像池来引导生成更安全的提示词后缀。
研究人员提出了 DiSCO,这是一种面向文生图系统的零样本防御方法,完全在提示词层面运行。该方法针对的是这样一类情况:语言上安全的提示词仍会因模型学到的分布而生成有害输出。DiSCO 通过后缀扩展、束搜索、对安全与不安全图像池进行对比评分,以及来自目标模型的迭代反馈来发挥作用。
⚡ 今天就能用
在依赖仅由 LLM 改写提示词来做文生图安全过滤之前,先阅读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。