Studie testet DeepSeek Harness gegen Prompt Injection
Eine Zusammenfassung von HF Daily Papers berichtet über 14.560 kontrollierte Ausführungen in 16 Kanälen für indirekte Inhalte.
Warum es wichtig ist
Die Ergebnisse zeigen, dass Agentensysteme verwundbar bleiben können, wenn nicht vertrauenswürdige Inhalte in Tool-Ergebnisse, zusätzlichen Kontext oder Richtlinienpfade für Tool-Aufrufe gelangen. Das Paper verweist auf die Notwendigkeit von Kontrollen zwischen nicht vertrauenswürdigen Inhalten und sensiblen Aktionen.
Die Kernpunkte
- 1.14.560 Ausführungen testeten die Widerstandsfähigkeit von DeepSeek Harness gegen Prompt Injection.
- 2.Verstecktes Unicode im Dateimodus erreichte eine Angriffserfolgsrate von 25,5 %.
- 3.Kontrollen sollten nicht vertrauenswürdige Inhalte von sensiblen Aktionen trennen.
Eine Sicherheitsbewertung untersuchte indirekte Prompt Injection in DeepSeek Harness. Dafür nutzte sie AI-Infra-Guard, um Tests zu erstellen, kontrollierte Taint-Daten einzuspeisen, das Harness auszuführen, Traces zu sammeln und Ergebnisse zu bewerten. Die Studie umfasste 14.560 kontrollierte Ausführungen über 16 Kanäle für indirekte Inhalte, Text- und Datei-Trägermodi, 35 Payload-Ziele, eine unveränderte Baseline und 12 Angriffsmethoden. Die höchsten beobachteten Erfolgsraten lagen bei 17,0 % für Fake-Completion-Angriffe im Textmodus, 25,5 % für verstecktes Unicode im Dateimodus und 16,0 % für den Skills-Kanal im Dateimodus.
⚡ Heute ausprobieren
Prüfen Sie Agenten-Workflows darauf, ob nicht vertrauenswürdige Texte oder Dateien sensible Tool-Aufrufe erreichen, insbesondere verstecktes Unicode und Eingaben über den Skills-Kanal.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.