论文研究 LLM Agent 的 GPU 控制路径
Ready Cohorts 建模了 Agent 控制工作何时可以留在 GPU 上,而不是返回主机端。
为什么重要
这项工作瞄准了 Agent 服务中一个日益突出的系统瓶颈:模型调用与工具调用之间频繁发生的控制转换。它表明,GPU 驻留式路由可能减少主机往返,但论文报告的基于 trace 的结果受其假设约束,并不能证明可执行身份等价。
核心要点
- 1.Ready Cohorts 为 LLM Agent 控制路径中的 GPU 机会设定边界。
- 2.主要 trace 重放在既定条件下报告 P*=43.00%。
- 3.在研究的全部 36 种配置中,设备驻留式路由都更快。
一篇新的 arXiv 论文(也被 HF Daily Papers 收录)研究了 LLM Agent 服务中的小型确定性控制转换,是否能暴露出足够的并发工作量以便在 GPU 上执行。作者使用一个固定的 851 会话公开 trace 面板进行平稳泊松重放,并报告称,在 100,000 个目标活跃会话、K=256、50 ms 启动截止时间这一主要条件下,F=30.19%、P*=43.00%、U=45.85%。他们还研究了将 GPU 计算出的二元路由决策保留在设备端,而不是把四个字节返回主机再重新分发;结果显示,在来源描述的全部 36 种配置中,设备驻留路径都更快。
⚡ 今天就能用
在把 Agent 编排迁移到 GPU 上之前,先阅读这篇论文,并用你自己的路由 trace 对照其 ready-cohort 假设进行基准测试。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。