AAI News Hub
InvestigaciónWed, August 19, 2026·23h ago2 sources corroborating

HarnessRisk evalúa fallos de seguridad en arneses de agentes

El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.

Por qué importa

Los hallazgos sugieren que la seguridad de los agentes no depende solo del comportamiento del modelo, sino también de cómo se configuran y aprovisionan los arneses. En infraestructura y otros despliegues de alto riesgo, limitar el acceso del arnés a las necesidades de la tarea puede reducir la exposición innecesaria.

Puntos clave

  • 1.HarnessRisk cubre seis fases de operación de los arneses de agentes.
  • 2.El éxito de los ataques osciló entre el 12,6% y el 80,9% en las configuraciones probadas.
  • 3.La configuración del arnés fue la fase más vulnerable.

Investigadores presentaron HarnessRisk, un benchmark orientado al ciclo de vida para evaluar fallos de seguridad en arneses de agentes LLM que gestionan herramientas, estado, permisos y acciones externas. El benchmark incluye 128 casos en entornos sandbox a lo largo de seis fases operativas y mide utilidad, tasa de éxito de los ataques, persistencia y detección. En tres arneses, seis modelos de lenguaje y 14 configuraciones, el éxito de los ataques osciló entre el 12,6% y el 80,9%, mientras que la utilidad varió entre el 75,0% y el 97,6%; la configuración del arnés fue la fase más vulnerable.

Pruébalo hoy

Auditar la configuración y los permisos de los arneses de agentes antes de ampliar el acceso a herramientas o estado.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación