Forscher schlagen DASH vor, um übermäßiges Grübeln in Reasoning-Modellen zu reduzieren
Die Methode zur Credit-Zuweisung auf Segmentebene nutzt Zwischenfestlegungen auf Antworten, um das Training von Reasoning-Modellen zu steuern.
Warum es wichtig ist
Die Arbeit zielt auf eine praktische Ineffizienz von Reasoning-Modellen: Längere Gedankengänge können Kosten erhöhen, ohne die Genauigkeit zu verbessern. Credit-Zuweisung auf Segmentebene könnte Trainingsmethoden dabei helfen, nützliche Reflexion zu belohnen und unproduktive Reasoning-Schleifen zu bremsen.
Die Kernpunkte
- 1.DASH weist Credit auf Ebene einzelner Reasoning-Segmente zu.
- 2.Die Methode nutzt Zwischenfestlegungen auf Antworten als Proxy-Signal.
- 3.Sie meldet eine durchschnittliche Genauigkeit von 59,45% auf Mathematik-Benchmarks auf Wettbewerbsniveau.
Ein arXiv-Paper stellt DASH vor, kurz für Drift Aware advantage SHaping, eine Methode zur Credit-Zuweisung auf Segmentebene für Reasoning-Sprachmodelle. Den Autoren zufolge neigen Reasoning-Modelle oft zu übermäßigem Grübeln, etwa durch Absicherung, verworfene Ansätze und Selbstwidersprüche, und verbrauchen dabei Tokens, ohne die Antworten zu verbessern. DASH nutzt Zwischenfestlegungen auf Antworten als kostengünstigen Proxy, um zu bewerten, ob spätere Reflexionen näher an die Korrektheit heranführen oder davon wegdriften. Die Methode kommt auf Mathematik-Benchmarks auf Wettbewerbsniveau, bei denen übermäßiges Grübeln verbreitet ist, auf eine durchschnittliche Genauigkeit von 59,45%, verglichen mit 58,1% für Dr.GRPO und 56,95% für GRPO.
⚡ Heute ausprobieren
Lesen Sie das Paper, bevor Sie RL-Zielgrößen für Reasoning-Modelle abstimmen, die lange Chain-of-Thoughts belohnen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.
InternLM schlägt Mobius-Modellarchitektur vor
Das arXiv-Paper trennt Gedächtnis und Schlussfolgern, um Kompression und Inferenz effizienter zu machen.