Un estudio prueba DeepSeek Harness frente a la inyección de prompts
Un resumen de HF Daily Papers informa de 14.560 ejecuciones controladas en 16 canales de contenido indirecto.
Por qué importa
Los resultados muestran que los sistemas de agentes pueden seguir siendo vulnerables cuando contenido no confiable llega a resultados de herramientas, contexto añadido o rutas de política de llamadas a herramientas. El paper apunta a la necesidad de controles entre el contenido no confiable y las acciones sensibles.
Puntos clave
- 1.14.560 ejecuciones pusieron a prueba la resistencia de DeepSeek Harness a la inyección de prompts.
- 2.Unicode oculto en modo archivo alcanzó una tasa de éxito de ataque del 25,5%.
- 3.Los controles deben separar el contenido no confiable de las acciones sensibles.
Una evaluación de seguridad analizó la inyección indirecta de prompts en DeepSeek Harness usando AI-Infra-Guard para construir pruebas, entregar contaminación controlada, ejecutar el harness, recopilar trazas y evaluar los resultados. El estudio abarcó 14.560 ejecuciones controladas en 16 canales de contenido indirecto, modos de transporte de texto y archivo, 35 objetivos de payload, una línea base sin modificar y 12 métodos de ataque. Las tasas de éxito de ataque más altas observadas fueron del 17,0% para ataques de finalización falsa en modo texto, del 25,5% para Unicode oculto en modo archivo y del 16,0% para el canal de skills en modo archivo.
⚡ Pruébalo hoy
Audita los flujos de trabajo de agentes para detectar texto o archivos no confiables que lleguen a llamadas a herramientas sensibles, especialmente entradas con Unicode oculto y del canal de skills.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.