R^3-Bench testet LLM-Schlussfolgern unter gemeinsamen Budgets
Der Benchmark bewertet sechs Modelle über Aufgabensuiten hinweg bei begrenzter Rechenzeit.
Warum es wichtig ist
Die Ergebnisse deuten darauf hin, dass aktuelle LLMs Schwierigkeiten haben, gemeinsame Reasoning-Budgets zu verwalten, selbst wenn sie bei einzelnen Aufgaben bereits Kompetenz gezeigt haben. Diese Lücke ist relevant für Agentensysteme, die Aufgaben unter Zeit- oder Rechenbeschränkungen priorisieren sollen.
Die Kernpunkte
- 1.R^3-Bench bewertet Suiten aus sechs Aufgaben unter gemeinsamen Budgets.
- 2.Das Orakel übertraf oder erreichte die Wettbewerbsleistung in allen 72 Zellen.
- 3.Diagnosen zeigten eine begrenzte Strategieanpassung unter Druck.
Forschende haben R^3-Bench vorgestellt, einen Benchmark zur Bewertung, wie Sprachmodelle begrenzte Rechenressourcen über Suiten aus jeweils sechs Aufgaben verteilen. Der Benchmark umfasst Mathematik, kompetitives Programmieren und abstraktes Schlussfolgern in toolfreien und agentischen Settings und vergleicht die Wettbewerbsleistung der Modelle mit offline ermittelten empirischen Orakeln, die aus Antwortkurven für Einzelaufgaben erstellt wurden. Über 72 Zellen der Haupttabelle für sechs Modelle hinweg erreichte oder übertraf das Orakel in allen Zellen die Wettbewerbsleistung und lag in 71 Fällen strikt darüber.
⚡ Heute ausprobieren
Nutzen Sie Shared-Budget-Evaluationen, nicht nur Benchmarks pro Aufgabe, wenn Sie Reasoning-Agenten für eingeschränkte Workflows testen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Startup sieht Daten als Schlüssel für Fortschritte bei KI gegen Krebs
TechCrunch berichtet, das Startup argumentiere, KI sei ohne bessere Daten noch nicht kurz davor, Krebs zu heilen.
HarnessRisk bewertet Sicherheitsversagen in Agent-Harnesses
Der Benchmark testet Angriffe über verschiedene Phasen von Agent-Harnesses hinweg, während verwandte Arbeiten aufgabenspezifische Bereitstellung untersuchen.
Agent Lightning v1.0 zielt auf agentisches RL mit Harness ab
Das Framework verbindet beliebige Agent-Harnesses mit Post-Training per Reinforcement Learning.