InternLM 提出 Mobius 模型架构
这篇 arXiv 论文通过分离记忆与推理来提升压缩能力和推理效率。
为什么重要
这项工作瞄准了基础模型效率中的一个核心问题:在保持推理性能的同时,减少冗余的知识存储。如果其效果能在已报告基准之外得到验证,这种记忆与推理分离的思路可能会影响未来的模型架构研究。
核心要点
- 1.Mobius-v0 将 FFN 记忆与自注意力推理器分离。
- 2.7B 模型仅用 62.6% 的训练数据就追平了基线。
- 3.Intern-S2-Mobius 报告称端到端推理速度接近提升 4 倍。
InternLM 发布了 Mobius-v0,这是一种将知识存储与推理过程分离的基础模型架构。该设计使用全局共享的 FFN 记忆来存放知识向量,并通过多个自注意力推理器反复查询这块记忆。作者称,一个从零训练的 7B 模型仅使用 62.6% 的训练数据,就达到了 7B Transformer 基线的水平;而基于 Qwen3.5-35B 持续预训练得到的 Intern-S2-Mobius,在下游任务得分相近的同时,实现了接近 4 倍的端到端推理加速。
⚡ 今天就能用
在采纳 Mobius 式效率主张之前,先阅读 arXiv 论文,并测试其发布的 GitHub 或 HuggingFace 模型。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。