AAI News Hub
ForschungThu, August 20, 2026·13h ago2 sources corroborating

SkillGate zielt auf die Skill-Auswahl in Long-Horizon-Agenten

Das Paper schlägt getrennte Credit-Kanäle für die Auswahl und Ausführung von Agenten-Skills vor.

Warum es wichtig ist

Da Agentensysteme auf immer größere Skill-Bibliotheken angewiesen sind, wird die Wahl des richtigen Skills zu einer Policy-Entscheidung statt zu einem festen Orchestrierungsschritt. Die Arbeit macht auf einen Trainingsfehler aufmerksam, der die Zuverlässigkeit von Long-Horizon-Agenten beeinträchtigen könnte.

Die Kernpunkte

  • 1.Skill-Auswahl wird als In-Policy-Entscheidung während Agenten-Episoden verstanden.
  • 2.RL mit Ergebnisbelohnung kann Skill-Auswahl-Tokens falschen Credit zuweisen.
  • 3.SkillGate trennt den Credit für die Auswahl von Skills von dem für ihre Ausführung.

Ein neues Paper mit dem Titel „SkillGate“ argumentiert, dass Long-Horizon-Agenten-Frameworks ein Trainingssignal dafür fehlt, zu entscheiden, welche prozedurale Skill-Datei während einer Episode gelesen werden soll. Die Autoren identifizieren „selector credit starvation“: Bei Reinforcement Learning mit Ergebnisbelohnung erhalten Tokens zur Skill-Auswahl zu wenig und mit zunehmender Trajektorienlänge immer stärker fehlgeleiteten Credit. SkillGate begegnet dem Problem, indem es Ergebnis-Credit für Ausführungs-Tokens von einem aktionslokalen Advantage für Skill-Naming-Tokens trennt.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie Agenten trainieren, die mit RL-Belohnungen auf Sequenzebene aus großen Skill-Bibliotheken auswählen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung