AAI News Hub
PesquisaWed, August 19, 2026·11h ago2 sources corroborating

DiSCO mira a segurança de geração de texto para imagem em modelos de caixa-preta

O artigo no arXiv propõe otimização no nível do prompt para reduzir saídas NSFW sem acesso ao modelo.

Por que importa

Muitas defesas de segurança existentes pressupõem acesso aos componentes internos do modelo, o que limita seu uso com geradores de imagem proprietários. Uma abordagem estritamente de caixa-preta poderia facilitar a aplicação de intervenções de segurança em sistemas fechados e abertos, se for validada além do cenário relatado no artigo.

Pontos-chave

  • 1.O DiSCO funciona no nível do prompt, sem retreinamento nem acesso aos componentes internos do modelo.
  • 2.O método aborda prompts benignos que ainda assim disparam gerações NSFW.
  • 3.Ele usa conjuntos de imagens do modelo-alvo para orientar sufixos de prompt mais seguros.

Pesquisadores apresentaram o DiSCO, uma defesa zero-shot para sistemas de texto para imagem que opera inteiramente no nível do prompt. O método mira casos em que prompts linguisticamente seguros ainda geram saídas nocivas por causa da distribuição aprendida pelo modelo, usando expansão de sufixos, beam search, pontuação contrastiva sobre conjuntos de imagens seguras e inseguras e feedback iterativo do modelo-alvo.

Experimente hoje

Leia o artigo antes de confiar apenas em reescrita de prompts por LLMs para filtros de segurança em texto para imagem.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa