DiSCO cible la sécurité des générateurs texte-image en boîte noire
L’article publié sur arXiv propose une optimisation au niveau du prompt pour réduire les sorties NSFW sans accès au modèle.
Pourquoi c'est important
De nombreuses défenses de sécurité existantes supposent un accès aux mécanismes internes du modèle, ce qui limite leur utilisation avec des générateurs d’images propriétaires. Une approche strictement en boîte noire pourrait faciliter l’application d’interventions de sécurité à des systèmes fermés comme ouverts, si elle est validée au-delà du cadre rapporté dans l’article.
Points clés
- 1.DiSCO fonctionne au niveau du prompt, sans réentraînement ni accès aux mécanismes internes du modèle.
- 2.La méthode traite les prompts bénins qui déclenchent malgré tout des générations NSFW.
- 3.Elle utilise des ensembles d’images du modèle cible pour guider des suffixes de prompt plus sûrs.
Des chercheurs ont présenté DiSCO, une défense zero-shot pour les systèmes texte-image qui fonctionne entièrement au niveau du prompt. La méthode vise les cas où des prompts linguistiquement sûrs produisent malgré tout des contenus nuisibles en raison de la distribution apprise par le modèle, en combinant extension de suffixes, beam search, scoring contrastif sur des ensembles d’images sûres et non sûres, et retours itératifs du modèle cible.
⚡ À tester aujourd'hui
Lisez l’article avant de vous appuyer sur une simple réécriture de prompts par LLM pour les filtres de sécurité texte-image.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.