AAI News Hub
ForschungWed, August 19, 2026·8h ago2 sources corroborating

DiSCO zielt auf Sicherheit bei Black-Box-Text-zu-Bild-Systemen

Das arXiv-Paper schlägt eine Optimierung auf Prompt-Ebene vor, um NSFW-Ausgaben ohne Zugriff auf das Modell zu reduzieren.

Warum es wichtig ist

Viele bestehende Sicherheitsmechanismen setzen Zugriff auf interne Modellstrukturen voraus, was ihren Einsatz bei proprietären Bildgeneratoren einschränkt. Ein strikt Black-Box-basierter Ansatz könnte Sicherheitsmaßnahmen leichter auf geschlossene wie offene Systeme übertragbar machen, sofern er über das im Paper berichtete Setting hinaus validiert wird.

Die Kernpunkte

  • 1.DiSCO arbeitet auf Prompt-Ebene, ohne Retraining oder Zugriff auf Modellinterna.
  • 2.Die Methode adressiert harmlose Prompts, die dennoch NSFW-Generierungen auslösen.
  • 3.Sie nutzt Bildpools des Zielmodells, um sicherere Prompt-Suffixe zu steuern.

Forschende haben DiSCO vorgestellt, eine Zero-Shot-Verteidigung für Text-zu-Bild-Systeme, die vollständig auf Prompt-Ebene arbeitet. Die Methode zielt auf Fälle, in denen sprachlich unbedenkliche Prompts dennoch schädliche Ausgaben erzeugen, weil dies in der gelernten Verteilung des Modells angelegt ist. Dafür nutzt sie Suffix-Erweiterung, Beam Search, kontrastives Scoring über sichere und unsichere Bildpools sowie iteratives Feedback vom Zielmodell.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie sich bei Sicherheitsfiltern für Text-zu-Bild-Systeme allein auf LLM-basiertes Prompt-Rewriting verlassen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung