HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Warum es wichtig ist
Die Ergebnisse deuten darauf hin, dass Agentensicherheit nicht nur vom Verhalten des Modells abhängt, sondern auch davon, wie Harnesses konfiguriert und bereitgestellt werden. Bei Infrastruktur und anderen risikoreichen Einsätzen kann es unnötige Angriffsflächen verringern, den Harness-Zugriff auf die Erfordernisse der jeweiligen Aufgabe zu beschränken.
Die Kernpunkte
- 1.HarnessRisk deckt sechs Phasen des Betriebs von Agent-Harnesses ab.
- 2.Die Erfolgsrate der Angriffe lag über die getesteten Konfigurationen hinweg zwischen 12,6 % und 80,9 %.
- 3.Harness Configuration war die anfälligste Phase.
Forscher haben HarnessRisk vorgestellt, einen am Lebenszyklus orientierten Benchmark zur Bewertung von Sicherheitsversagen in LLM-Agent-Harnesses, die Tools, Zustand, Berechtigungen und externe Aktionen verwalten. Der Benchmark umfasst 128 sandboxierte Fälle über sechs Betriebsphasen hinweg und misst Utility, Attack Success Rate, Persistence und Detection. Über drei Harnesses, sechs Sprachmodelle und 14 Konfigurationen hinweg lag die Erfolgsrate der Angriffe zwischen 12,6 % und 80,9 %, während die Utility zwischen 75,0 % und 97,6 % lag; Harness Configuration war die anfälligste Phase.
⚡ Heute ausprobieren
Prüfen Sie Konfiguration und Berechtigungen von Agent-Harnesses, bevor Sie den Zugriff auf Tools oder Zustand erweitern.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.AIHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 19, 12:00 PM↗
- arXiv cs.AITask-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure OperationsAug 19, 12:00 PM↗
- HF Daily PapersHarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness SafetyAug 18, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.
Studie testet modellübergreifende Speicherübertragung für LLMs
Forschende untersuchen, wie sich eingefrorener gelernter Speicher mithilfe eines Readers auf Zielseite zwischen Modell-Backbones übertragen lässt.