AAI News Hub
研究Wed, August 5, 2026·Aug 52 家媒体交叉佐证

研究人员发现 ALiBi 注意力失效模式

论文称,浮点下溢可能让部分 ALiBi 注意力头出现“半失明”。

为什么重要

这一发现表明,常见基准测试结果可能漏掉由位置编码数值问题导致的检索弱点。它也为模型开发者在训练或评估基于 ALiBi 的长上下文系统时,提供了一个可具体测试的失效模式。

核心要点

  • 1.浮点下溢可能使 ALiBi 注意力权重归零。
  • 2.token 检索受到的影响比标准解码器基准更大。
  • 3.对数缩放距离带来了最稳定的 passkey 提升。

一篇新的 arXiv 论文指出,ALiBi 位置编码存在一种数值失效模式:线性偏置缩放可能触发浮点精度下溢,使大量注意力权重归零。作者报告称,这一问题出现在采用 ALiBi 的前沿预训练模型中,并可能显著削弱 token 检索能力,但对标准解码器基准测试的影响较小。在 1.48 亿参数解码器预训练实验中,他们评估了四种训练期缓解方案,发现对距离进行对数缩放最稳定地提升了 passkey 检索表现。

今天就能用

如果你在训练或评估 ALiBi 模型,应加入 token 检索和 passkey 测试,并将对数缩放距离缓解方案与默认斜率进行比较。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究