AAI News Hub
ForschungThu, August 13, 2026·4d ago2 sources corroborating

Paper fordert Laufzeitverträge für die Sicherheit von Agenten

Das arXiv-Paper argumentiert, dass Alignment während des Trainings für autonome Agenten nicht ausreicht.

Warum es wichtig ist

Das Paper rahmt Agentensicherheit neu als operatives Systemproblem für Tools, die Code ausführen, Dateien ändern, Nachrichten senden und Datenbanken verändern können. Sollte sich der Ansatz durchsetzen, würde er Entwickler von Agenten stärker zu Durchsetzung und Nachweiserfassung auf Harness-Ebene drängen, nicht nur zu Alignment auf Modellebene.

Die Kernpunkte

  • 1.Der Sicherheitsvertrag sollte im Agent-Harness verankert sein.
  • 2.Zu den Kontrollen gehören Sandboxes, Berechtigungsschranken und Trajektorien-Monitore.
  • 3.Nachweiskontrollen umfassen Tests, Logs, Diffs und zitationsgestützte Begründung.

Ein neues arXiv-Paper argumentiert, dass die Sicherheit von AI-Agenten als Laufzeitvertrag durch das Agent-Harness durchgesetzt werden sollte, statt vor allem als Eigenschaft behandelt zu werden, die beim Modelltraining erlernt wird. Die Autoren schlagen präventive Kontrollen wie Sandboxes, Berechtigungsschranken, Ausgabefilter und Trajektorien-Monitore vor, außerdem Nachweisanforderungen wie Testläufe, Log-Erfassungen, Datei-Diffs und zitationsgestützte Begründung vor der Aufgabenabgabe. Die Position stützt sich auf Audits zu 52 dokumentierten Sicherheitsvorfällen mit AI-Agenten und LLMs, 31 unbestrittenen Fällen falscher Fertigstellung, 12 öffentlichen Agentensystemen und Harnesses sowie 28.560 angenommenen NeurIPS-, ICML- und ICLR-Papers aus den Jahren 2023 bis 2025.

Heute ausprobieren

Prüfen Sie Ihr Agent-Harness auf Berechtigungsschranken, Sandboxing und Nachweiskontrollen, bevor eine Aufgabe als abgeschlossen gelten darf.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung