AAI News Hub
ForschungTue, August 4, 2026·Aug 4

Forscher legen SkillJack-Backdoor-Angriff auf Agenten offen

Der Angriff verwandelt vergiftete Agenten-Erfahrungen in dauerhaft wiederverwendbare Skills.

Warum es wichtig ist

Die Arbeit weist auf ein Sicherheitsrisiko hin, das speziell Agenten betrifft, die aus früheren Interaktionen dauerhafte Fähigkeiten lernen. Sie legt nahe, dass das Entfernen vergifteter Quelldatensätze womöglich nicht ausreicht, wenn das Verhalten bereits in wiederverwendbare Skills überführt wurde.

Die Kernpunkte

  • 1.SkillJack zielt auf die Experience-to-Skill-Pipeline in selbst-evolvierenden Agenten.
  • 2.Schädliches Verhalten kann bestehen bleiben, nachdem die ursprünglich vergifteten Datensätze entfernt wurden.
  • 3.Das Paper evaluiert den Angriff auf SkillX und Anything2Skill.

Ein Paper auf Hugging Face Daily Papers stellt SkillJack vor, einen Angriff auf selbst-evolvierende Agenten, die Interaktionsverläufe in wiederverwendbare Skills umwandeln. Die Autoren erklären, dass der Angriff die Pipeline von Erfahrung zu Skill kapert, um schädliches Verhalten im dauerhaften Skill-Repertoire eines Agenten zu verankern, statt darauf zu setzen, dass vergifteter Kontext zur Laufzeit abgerufen wird. Sie benennen drei Eigenschaften: Sanitization Whitewashing, Cross-Layer Promotion und Persistence Isolation, und evaluieren den Angriff auf SkillX und Anything2Skill anhand von 150 Trajektorien in vier Kategorien politischer Risiken.

Heute ausprobieren

Prüft Pipelines selbst-evolvierender Agenten darauf, wie Erfahrungen in persistente Skills umgewandelt werden, nicht nur auf Poisoning zum Abrufzeitpunkt.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung