AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

研究人员瞄准扩散语言模型中的 MoE 效率

多篇新论文提出针对 MoE 扩散语言模型的路由和算力分配调整。

为什么重要

这些论文指向一个共同问题:从自回归模型直接照搬而来的 MoE 技术,可能会在扩散语言模型中浪费算力,或分配不当。更好的路由和容量分配方式,可能让基于扩散的 LLM 更适合高吞吐或对延迟敏感的部署场景。

核心要点

  • 1.MoE 扩散模型可能需要围绕去噪过程设计路由。
  • 2.REFLEX 无需重新训练路由器即可重新分配专家计算。
  • 3.LLaDA MoE v2 研究了 30B-A3B dLLM 的扩展规律。

多篇新论文探讨了混合专家(MoE)路由在扩散语言模型中应如何调整。不同于自回归模型按下一个 token 逐步预测,扩散语言模型通过迭代去噪生成文本。REFLEX 提出了一种无需训练的方法,在保留默认路由器的同时,围绕 token 的细化状态重新分配专家计算。其他研究则认为,专家选择路由、依时间步变化的容量,以及由一致性引导的专家激活,可以改善负载均衡、收敛、吞吐量或推理开销;而 LLaDA MoE v2 报告了一个在 23.5T tokens 上训练的 30B-A3B MoE 扩散语言模型的扩展规律研究结果。

今天就能用

如果你正在试验 MoE 扩散 LLM,应将路由和专家容量调度与自回归 MoE 的默认做法分开评估。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究