AAI News Hub
ForschungMon, August 17, 2026·2d ago2 sources corroborating

R^3-Bench testet LLM-Schlussfolgern unter gemeinsamen Budgets

Der Benchmark bewertet sechs Modelle über Aufgabensuiten hinweg bei begrenzter Rechenzeit.

Warum es wichtig ist

Die Ergebnisse deuten darauf hin, dass aktuelle LLMs Schwierigkeiten haben, gemeinsame Reasoning-Budgets zu verwalten, selbst wenn sie bei einzelnen Aufgaben bereits Kompetenz gezeigt haben. Diese Lücke ist relevant für Agentensysteme, die Aufgaben unter Zeit- oder Rechenbeschränkungen priorisieren sollen.

Die Kernpunkte

  • 1.R^3-Bench bewertet Suiten aus sechs Aufgaben unter gemeinsamen Budgets.
  • 2.Das Orakel übertraf oder erreichte die Wettbewerbsleistung in allen 72 Zellen.
  • 3.Diagnosen zeigten eine begrenzte Strategieanpassung unter Druck.

Forschende haben R^3-Bench vorgestellt, einen Benchmark zur Bewertung, wie Sprachmodelle begrenzte Rechenressourcen über Suiten aus jeweils sechs Aufgaben verteilen. Der Benchmark umfasst Mathematik, kompetitives Programmieren und abstraktes Schlussfolgern in toolfreien und agentischen Settings und vergleicht die Wettbewerbsleistung der Modelle mit offline ermittelten empirischen Orakeln, die aus Antwortkurven für Einzelaufgaben erstellt wurden. Über 72 Zellen der Haupttabelle für sechs Modelle hinweg erreichte oder übertraf das Orakel in allen Zellen die Wettbewerbsleistung und lag in 71 Fällen strikt darüber.

Heute ausprobieren

Nutzen Sie Shared-Budget-Evaluationen, nicht nur Benchmarks pro Aufgabe, wenn Sie Reasoning-Agenten für eingeschränkte Workflows testen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung