Une étude teste DeepSeek Harness face aux injections de prompt
Le résumé de HF Daily Papers fait état de 14 560 exécutions contrôlées sur 16 canaux de contenu indirect.
Pourquoi c'est important
Les résultats montrent que les systèmes d’agents peuvent rester vulnérables lorsque du contenu non fiable atteint les résultats d’outils, le contexte ajouté ou les chemins de politique d’appel d’outils. L’article souligne la nécessité de contrôles entre les contenus non fiables et les actions sensibles.
Points clés
- 1.14 560 exécutions ont testé la résistance de DeepSeek Harness aux injections de prompt.
- 2.L’Unicode masqué en mode fichier a atteint un taux de réussite d’attaque de 25,5 %.
- 3.Les contrôles doivent séparer le contenu non fiable des actions sensibles.
Une évaluation de sécurité a analysé l’injection de prompt indirecte dans DeepSeek Harness, en utilisant AI-Infra-Guard pour construire les tests, transmettre une contamination contrôlée, exécuter le harness, collecter les traces et juger les résultats. L’étude a porté sur 14 560 exécutions contrôlées couvrant 16 canaux de contenu indirect, des modes de transport par texte et par fichier, 35 objectifs de payload, une référence non modifiée et 12 méthodes d’attaque. Les taux de réussite d’attaque les plus élevés observés ont été de 17,0 % pour les attaques par fausse complétion en mode texte, 25,5 % pour l’Unicode masqué en mode fichier et 16,0 % pour le canal skills en mode fichier.
⚡ À tester aujourd'hui
Auditer les workflows d’agents afin de repérer les textes ou fichiers non fiables susceptibles d’atteindre des appels d’outils sensibles, en particulier l’Unicode masqué et les entrées du canal skills.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.