AAI News Hub
研究Tue, August 18, 2026·2d ago2 家媒体交叉佐证

新研究勾勒智能体 AI 的服务供给需求

四篇论文分别研究面向智能体 LLM 工作负载的延迟、缓存、轨迹和边缘侧服务。

为什么重要

这些论文指向 AI 基础设施需求的一次转变:服务系统不仅要关注 GPU 推理吞吐量,还必须处理状态、工具执行、异构资源和可复用的智能体上下文。这可能影响智能体应用的基准测试、缓存策略、负载均衡和本地部署方案。

核心要点

  • 1.智能体工作负载为服务系统带来了有状态的非 LLM 瓶颈。
  • 2.缓存复用取决于智能体执行语义,而不只是最近使用时间。
  • 3.边缘侧 MoE 服务研究面向异构个人硬件。

研究人员发布了多篇系统论文,聚焦应用从单次推理调用转向智能体式、工具调用和多智能体工作负载后,LLM 服务方式会如何变化。AgentSysBench 刻画了十个智能体应用,并发现其中五个应用的延迟主要由非 LLM 组件主导,而沙箱内存每个会话峰值可达 28 GB。其他研究提出了用于智能体感知 KV 缓存管理的 CacheScout,分析了 Chutes 一年期生产轨迹,并介绍了 FreeToken,用于在个人硬件上实现带宽自适应的 MoE 服务。

今天就能用

在设计智能体基础设施前,应先审阅这些论文,尤其关注缓存策略、沙箱内存限制和工具运行时的部署位置。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究