AAI News Hub
研究Wed, August 5, 2026·Aug 52 家媒体交叉佐证

ARCHead 瞄准 LLM 输出头压缩

一篇新的 arXiv 论文称,该方法可在不保留密集 BF16 输出头的情况下压缩 LM-head 存储。

为什么重要

即使 transformer 模块已经量化,输出头也常常仍保留为 BF16 或 FP16,给实际部署留下存储缺口。ARCHead 通过处理这最后一层投影层,可能让仅权重量化的 LLM 进一步变小。

核心要点

  • 1.将 LM-head 存储压缩 3.7-3.9 倍。
  • 2.在 Qwen3-8B-Base 上使用 BF16 输出头存储的 25.6%。
  • 3.报告测试中的吞吐量变化低于 2%。

研究人员推出了 ARCHead,这是一种面向大型语言模型输出头的打包压缩器,结合了量化低秩核心、按组 INT4 残差,以及在由激活推导出的度量中拟合的低秩校正。论文称,ARCHead 可将持久化 LM-head 存储减少 3.7-3.9 倍;在 Qwen3-8B-Base 上,仅使用 BF16 输出头存储的 25.6%,同时达到 1.007 的相对困惑度。作者的测量显示,替换 AWQ 或 bitsandbytes 保留下来的 BF16 输出头,会带来 0.006-0.007 的交叉熵增加,吞吐量变化低于 2%。

今天就能用

如果你部署 AWQ 或 bitsandbytes 量化模型,应查看 ARCHead 代码,并先在目标模型上测试输出头压缩,再决定是否继续依赖 BF16 输出头。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究