研究人员瞄准扩散语言模型中的 MoE 效率
多篇新论文提出针对 MoE 扩散语言模型的路由和算力分配调整。
为什么重要
这些论文指向一个共同问题:从自回归模型直接照搬而来的 MoE 技术,可能会在扩散语言模型中浪费算力,或分配不当。更好的路由和容量分配方式,可能让基于扩散的 LLM 更适合高吞吐或对延迟敏感的部署场景。
核心要点
- 1.MoE 扩散模型可能需要围绕去噪过程设计路由。
- 2.REFLEX 无需重新训练路由器即可重新分配专家计算。
- 3.LLaDA MoE v2 研究了 30B-A3B dLLM 的扩展规律。
多篇新论文探讨了混合专家(MoE)路由在扩散语言模型中应如何调整。不同于自回归模型按下一个 token 逐步预测,扩散语言模型通过迭代去噪生成文本。REFLEX 提出了一种无需训练的方法,在保留默认路由器的同时,围绕 token 的细化状态重新分配专家计算。其他研究则认为,专家选择路由、依时间步变化的容量,以及由一致性引导的专家激活,可以改善负载均衡、收敛、吞吐量或推理开销;而 LLaDA MoE v2 报告了一个在 23.5T tokens 上训练的 30B-A3B MoE 扩散语言模型的扩展规律研究结果。
⚡ 今天就能用
如果你正在试验 MoE 扩散 LLM,应将路由和专家容量调度与自回归 MoE 的默认做法分开评估。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AILLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AIREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.LGExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.CLTEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model AccelerationAug 4, 12:00 PM↗
- arXiv cs.CLREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- HF Daily PapersLLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 4, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。