AAI News Hub
ForschungWed, August 5, 2026·Aug 52 sources corroborating

Forscher schlagen DASH vor, um übermäßiges Grübeln in Reasoning-Modellen zu reduzieren

Die Methode zur Credit-Zuweisung auf Segmentebene nutzt Zwischenfestlegungen auf Antworten, um das Training von Reasoning-Modellen zu steuern.

Warum es wichtig ist

Die Arbeit zielt auf eine praktische Ineffizienz von Reasoning-Modellen: Längere Gedankengänge können Kosten erhöhen, ohne die Genauigkeit zu verbessern. Credit-Zuweisung auf Segmentebene könnte Trainingsmethoden dabei helfen, nützliche Reflexion zu belohnen und unproduktive Reasoning-Schleifen zu bremsen.

Die Kernpunkte

  • 1.DASH weist Credit auf Ebene einzelner Reasoning-Segmente zu.
  • 2.Die Methode nutzt Zwischenfestlegungen auf Antworten als Proxy-Signal.
  • 3.Sie meldet eine durchschnittliche Genauigkeit von 59,45% auf Mathematik-Benchmarks auf Wettbewerbsniveau.

Ein arXiv-Paper stellt DASH vor, kurz für Drift Aware advantage SHaping, eine Methode zur Credit-Zuweisung auf Segmentebene für Reasoning-Sprachmodelle. Den Autoren zufolge neigen Reasoning-Modelle oft zu übermäßigem Grübeln, etwa durch Absicherung, verworfene Ansätze und Selbstwidersprüche, und verbrauchen dabei Tokens, ohne die Antworten zu verbessern. DASH nutzt Zwischenfestlegungen auf Antworten als kostengünstigen Proxy, um zu bewerten, ob spätere Reflexionen näher an die Korrektheit heranführen oder davon wegdriften. Die Methode kommt auf Mathematik-Benchmarks auf Wettbewerbsniveau, bei denen übermäßiges Grübeln verbreitet ist, auf eine durchschnittliche Genauigkeit von 59,45%, verglichen mit 58,1% für Dr.GRPO und 56,95% für GRPO.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie RL-Zielgrößen für Reasoning-Modelle abstimmen, die lange Chain-of-Thoughts belohnen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung