AAI News Hub
InvestigaciónWed, August 19, 2026·8h ago2 sources corroborating

DiSCO apunta a la seguridad de texto a imagen en modelos de caja negra

El paper de arXiv propone una optimización a nivel de prompt para reducir salidas NSFW sin acceder al modelo.

Por qué importa

Muchas defensas de seguridad existentes asumen acceso a los componentes internos del modelo, lo que limita su uso con generadores de imágenes propietarios. Un enfoque estrictamente de caja negra podría hacer que las intervenciones de seguridad sean más fáciles de aplicar tanto en sistemas cerrados como abiertos, si se valida más allá del entorno reportado en el paper.

Puntos clave

  • 1.DiSCO funciona a nivel de prompt, sin reentrenamiento ni acceso a los componentes internos del modelo.
  • 2.El método aborda prompts benignos que aun así desencadenan generaciones NSFW.
  • 3.Usa conjuntos de imágenes del modelo objetivo para orientar sufijos de prompt más seguros.

Investigadores presentaron DiSCO, una defensa zero-shot para sistemas de texto a imagen que opera por completo a nivel de prompt. El método se centra en casos en los que prompts lingüísticamente seguros aun así producen resultados dañinos debido a la distribución aprendida del modelo, usando expansión de sufijos, beam search, puntuación contrastiva sobre conjuntos de imágenes seguras e inseguras, y feedback iterativo del modelo objetivo.

Pruébalo hoy

Lee el paper antes de confiar en reescrituras de prompts solo con LLM para filtros de seguridad en texto a imagen.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación