AAI News Hub
研究Mon, August 17, 2026·2d ago2 家媒体交叉佐证

R^3-Bench 在共享预算下测试 LLM 推理能力

该基准在计算受限条件下,评估六个模型在多组问题套件中的表现。

为什么重要

结果表明,即使当前 LLM 在单个问题上已展现能力,也仍难以管理共享推理预算。对于需要在时间或计算约束下确定任务优先级的智能体系统来说,这一差距很重要。

核心要点

  • 1.R^3-Bench 在共享预算下评估六题套件。
  • 2.oracle 在全部 72 个单元中超过或持平竞赛表现。
  • 3.诊断发现,模型在压力下更新策略的能力有限。

研究人员推出了 R^3-Bench,用于评估语言模型如何在六题套件中分配有限计算资源。该基准覆盖数学、竞技编程和抽象推理任务,包含无工具和智能体设置,并将模型的竞赛表现与基于单题响应曲线构建的离线经验 oracle 进行比较。在六个模型的 72 个主表格单元中,oracle 的表现全部持平或超过竞赛表现,其中 71 个单元严格更高。

今天就能用

测试受限工作流中的推理智能体时,应采用共享预算评估,而不只是逐任务基准。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究