AAI News Hub
InvestigaciónTue, August 18, 2026·2d ago

Un estudio prueba DeepSeek Harness frente a la inyección de prompts

Un resumen de HF Daily Papers informa de 14.560 ejecuciones controladas en 16 canales de contenido indirecto.

Por qué importa

Los resultados muestran que los sistemas de agentes pueden seguir siendo vulnerables cuando contenido no confiable llega a resultados de herramientas, contexto añadido o rutas de política de llamadas a herramientas. El paper apunta a la necesidad de controles entre el contenido no confiable y las acciones sensibles.

Puntos clave

  • 1.14.560 ejecuciones pusieron a prueba la resistencia de DeepSeek Harness a la inyección de prompts.
  • 2.Unicode oculto en modo archivo alcanzó una tasa de éxito de ataque del 25,5%.
  • 3.Los controles deben separar el contenido no confiable de las acciones sensibles.

Una evaluación de seguridad analizó la inyección indirecta de prompts en DeepSeek Harness usando AI-Infra-Guard para construir pruebas, entregar contaminación controlada, ejecutar el harness, recopilar trazas y evaluar los resultados. El estudio abarcó 14.560 ejecuciones controladas en 16 canales de contenido indirecto, modos de transporte de texto y archivo, 35 objetivos de payload, una línea base sin modificar y 12 métodos de ataque. Las tasas de éxito de ataque más altas observadas fueron del 17,0% para ataques de finalización falsa en modo texto, del 25,5% para Unicode oculto en modo archivo y del 16,0% para el canal de skills en modo archivo.

Pruébalo hoy

Audita los flujos de trabajo de agentes para detectar texto o archivos no confiables que lleguen a llamadas a herramientas sensibles, especialmente entradas con Unicode oculto y del canal de skills.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación