R^3-Bench teste le raisonnement des LLM sous budgets partagés
Le benchmark évalue six modèles sur des séries de problèmes avec une puissance de calcul limitée.
Pourquoi c'est important
Les résultats suggèrent que les LLM actuels peinent à gérer des budgets de raisonnement partagés, même lorsqu’ils ont déjà démontré leurs capacités sur des problèmes individuels. Cet écart compte pour les systèmes agentiques censés hiérarchiser les tâches sous contraintes de temps ou de calcul.
Points clés
- 1.R^3-Bench évalue des séries de six problèmes sous budgets partagés.
- 2.L’oracle a battu ou égalé les performances en concours dans les 72 cellules.
- 3.Les diagnostics ont révélé une mise à jour limitée des stratégies sous pression.
Des chercheurs ont présenté R^3-Bench, un benchmark destiné à évaluer la manière dont les modèles de langage répartissent une capacité de calcul limitée entre des séries de six problèmes. Le benchmark couvre les mathématiques, la programmation compétitive et le raisonnement abstrait, dans des configurations sans outils et agentiques, et compare les performances des modèles en conditions de concours à des oracles empiriques hors ligne construits à partir de courbes de réponse sur des problèmes isolés. Sur les 72 cellules du tableau principal pour six modèles, l’oracle a égalé ou dépassé les performances en concours dans tous les cas, et les a strictement surpassées dans 71.
⚡ À tester aujourd'hui
Pour tester des agents de raisonnement dans des workflows contraints, utilisez des évaluations à budget partagé, et pas seulement des benchmarks par tâche.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Politique & sûreté
HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety
arXiv:2608.
OpenAI renforce ses garde-fous après une faille chez Hugging Face
L’entreprise intensifie la surveillance de ses modèles ainsi que ses travaux d’alignement et de sécurité après l’entraînement.
Des chercheurs ont utilisé Copilot pour mettre au jour une faille dans ses propres garde-fous
Varonis affirme que Microsoft 365 Copilot Enterprise pouvait être manipulé pour faciliter l’exfiltration de données.