DiSCO apunta a la seguridad de texto a imagen en modelos de caja negra
El paper de arXiv propone una optimización a nivel de prompt para reducir salidas NSFW sin acceder al modelo.
Por qué importa
Muchas defensas de seguridad existentes asumen acceso a los componentes internos del modelo, lo que limita su uso con generadores de imágenes propietarios. Un enfoque estrictamente de caja negra podría hacer que las intervenciones de seguridad sean más fáciles de aplicar tanto en sistemas cerrados como abiertos, si se valida más allá del entorno reportado en el paper.
Puntos clave
- 1.DiSCO funciona a nivel de prompt, sin reentrenamiento ni acceso a los componentes internos del modelo.
- 2.El método aborda prompts benignos que aun así desencadenan generaciones NSFW.
- 3.Usa conjuntos de imágenes del modelo objetivo para orientar sufijos de prompt más seguros.
Investigadores presentaron DiSCO, una defensa zero-shot para sistemas de texto a imagen que opera por completo a nivel de prompt. El método se centra en casos en los que prompts lingüísticamente seguros aun así producen resultados dañinos debido a la distribución aprendida del modelo, usando expansión de sufijos, beam search, puntuación contrastiva sobre conjuntos de imágenes seguras e inseguras, y feedback iterativo del modelo objetivo.
⚡ Pruébalo hoy
Lee el paper antes de confiar en reescrituras de prompts solo con LLM para filtros de seguridad en texto a imagen.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.
Un estudio prueba la transferencia de memoria entre modelos para LLMs
Investigadores analizan cómo una memoria aprendida y congelada puede moverse entre backbones de modelos mediante un lector del lado del modelo destino.