AAI News Hub
ForschungWed, August 5, 2026·Aug 52 sources corroborating

Forschende schlagen Skill Entropy für das Reasoning von LLMs vor

Skill^2-Bench testet, wie Modelle in langfristigen Aufgaben zwischen Fähigkeiten wechseln.

Warum es wichtig ist

Die Arbeit adressiert eine Lücke bei der Bewertung von langfristigem Reasoning: ob Modelle verschiedene Fähigkeiten zuverlässig in voneinander abhängigen Ketten kombinieren können. Sie legt nahe, dass der Wechsel zwischen Fähigkeiten selbst bei starken aktuellen Modellen eine messbare Schwäche ist.

Die Kernpunkte

  • 1.Skill Entropy misst, wie schwierig der Wechsel zwischen Reasoning-Fähigkeiten ist.
  • 2.Skill^2-Bench umfasst 558 Fähigkeiten in neun Domänen.
  • 3.Die evaluierten Modelle verloren bei Aufgaben mit höherer Entropie an Genauigkeit.

Ein neues Paper führt Skill Entropy ein, eine Kennzahl zur Bewertung, wie schwierig der Wechsel zwischen Reasoning-Fähigkeiten innerhalb mehrstufiger LLM-Aufgaben ist. Die Autorinnen und Autoren schlagen außerdem Skill^2-Bench vor, einen Benchmark mit 558 Fähigkeiten in neun überprüfbaren und offenen Domänen, und berichten, dass acht Frontier-Modelle sowie vier Open-Source-Modelle bei Aufgaben mit höherer Entropie an Genauigkeit verlieren. Zudem stellt das Paper Skill-Entropy RL vor, bei dem Skill Entropy als Trainingssignal genutzt wird.

Heute ausprobieren

Nutzen Sie Skill^2-Bench, um Agents oder Reasoning-Systeme einem Stresstest zu unterziehen, wenn sie mehrere Fähigkeiten über voneinander abhängige Schritte hinweg kombinieren müssen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung