AAI News Hub
RechercheWed, August 19, 2026·11h ago2 sources corroborating

DiSCO cible la sécurité des générateurs texte-image en boîte noire

L’article publié sur arXiv propose une optimisation au niveau du prompt pour réduire les sorties NSFW sans accès au modèle.

Pourquoi c'est important

De nombreuses défenses de sécurité existantes supposent un accès aux mécanismes internes du modèle, ce qui limite leur utilisation avec des générateurs d’images propriétaires. Une approche strictement en boîte noire pourrait faciliter l’application d’interventions de sécurité à des systèmes fermés comme ouverts, si elle est validée au-delà du cadre rapporté dans l’article.

Points clés

  • 1.DiSCO fonctionne au niveau du prompt, sans réentraînement ni accès aux mécanismes internes du modèle.
  • 2.La méthode traite les prompts bénins qui déclenchent malgré tout des générations NSFW.
  • 3.Elle utilise des ensembles d’images du modèle cible pour guider des suffixes de prompt plus sûrs.

Des chercheurs ont présenté DiSCO, une défense zero-shot pour les systèmes texte-image qui fonctionne entièrement au niveau du prompt. La méthode vise les cas où des prompts linguistiquement sûrs produisent malgré tout des contenus nuisibles en raison de la distribution apprise par le modèle, en combinant extension de suffixes, beam search, scoring contrastif sur des ensembles d’images sûres et non sûres, et retours itératifs du modèle cible.

À tester aujourd'hui

Lisez l’article avant de vous appuyer sur une simple réécriture de prompts par LLM pour les filtres de sécurité texte-image.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche