AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 4

SIGNPOST-Bench pone a prueba los conflictos texto-visión en los MLLM

Un nuevo benchmark muestra que el texto escénico adversarial degrada con fuerza la localización multimodal.

Por qué importa

Los resultados sugieren que los MLLM actuales pueden verse influidos de forma material por texto escénico contradictorio incluso cuando se conserva el contenido no textual de la imagen. Esto importa para la seguridad y la fiabilidad de los sistemas de visión-lenguaje usados en razonamiento situado en el mundo real.

Puntos clave

  • 1.SIGNPOST-Bench contiene 25.555 variantes de imágenes en cuatro conjuntos de datos.
  • 2.El texto adversarial aumentó 4,8 veces el error mediano de localización.
  • 3.Todos los modelos evaluados mostraron desplazamientos hacia los objetivos geográficos inyectados.

Investigadores presentaron SIGNPOST-Bench, un benchmark contrafactual controlado para evaluar cómo los grandes modelos de lenguaje multimodales resuelven conflictos entre señales visuales y textuales. El benchmark incluye 5.111 grupos contrafactuales y 25.555 variantes de imágenes procedentes de cuatro conjuntos de datos, y se utilizó para evaluar 20 MLLM de siete proveedores. En las variantes adversariales, el error mediano de localización aumentó de 282 km a 1.347 km, un incremento de 4,8 veces.

Pruébalo hoy

Use pruebas contrafactuales al estilo de SIGNPOST-Bench antes de confiar en MLLM para geolocalización o decisiones basadas en escenas.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación