Forschende schlagen Skill Entropy für das Reasoning von LLMs vor
Skill^2-Bench testet, wie Modelle in langfristigen Aufgaben zwischen Fähigkeiten wechseln.
Warum es wichtig ist
Die Arbeit adressiert eine Lücke bei der Bewertung von langfristigem Reasoning: ob Modelle verschiedene Fähigkeiten zuverlässig in voneinander abhängigen Ketten kombinieren können. Sie legt nahe, dass der Wechsel zwischen Fähigkeiten selbst bei starken aktuellen Modellen eine messbare Schwäche ist.
Die Kernpunkte
- 1.Skill Entropy misst, wie schwierig der Wechsel zwischen Reasoning-Fähigkeiten ist.
- 2.Skill^2-Bench umfasst 558 Fähigkeiten in neun Domänen.
- 3.Die evaluierten Modelle verloren bei Aufgaben mit höherer Entropie an Genauigkeit.
Ein neues Paper führt Skill Entropy ein, eine Kennzahl zur Bewertung, wie schwierig der Wechsel zwischen Reasoning-Fähigkeiten innerhalb mehrstufiger LLM-Aufgaben ist. Die Autorinnen und Autoren schlagen außerdem Skill^2-Bench vor, einen Benchmark mit 558 Fähigkeiten in neun überprüfbaren und offenen Domänen, und berichten, dass acht Frontier-Modelle sowie vier Open-Source-Modelle bei Aufgaben mit höherer Entropie an Genauigkeit verlieren. Zudem stellt das Paper Skill-Entropy RL vor, bei dem Skill Entropy als Trainingssignal genutzt wird.
⚡ Heute ausprobieren
Nutzen Sie Skill^2-Bench, um Agents oder Reasoning-Systeme einem Stresstest zu unterziehen, wenn sie mehrere Fähigkeiten über voneinander abhängige Schritte hinweg kombinieren müssen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.CLToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- arXiv cs.LGToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 6, 12:00 PM↗
- HF Daily PapersToward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon ReasoningAug 5, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor
Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.