ALiBi attentionに数値的な破綻の可能性、研究者が指摘
新論文は、ALiBiのアンダーフローが標準ベンチマークには大きく表れない一方で、トークン検索を損なう可能性があると報告している。
なぜ重要か
この発見は、一般的なベンチマークスコアでは、位置エンコーディングの数値処理に起因する長文脈検索の弱点を見逃す可能性があることを示している。また、ALiBiベースのシステムを改善するうえで、モデル開発者に学習時の具体的な対処目標を与えるものでもある。
要点
- 1.ALiBiのバイアススケーリングは浮動小数点精度でアンダーフローを起こす可能性がある。
- 2.トークン検索は、標準的なdecoderベンチマークよりも大きな影響を受ける。
- 3.対数スケールの距離表現は、passkey検索で最も一貫した改善を示した。
研究者らは、ALiBiの位置エンコーディングにおける数値的な失敗モードを特定した。線形バイアスのスケーリングが浮動小数点精度でアンダーフローを起こし、attention重みの大部分がゼロになって、影響を受けたattention headが部分的に情報を見失うという。研究チームは、この問題が最先端の事前学習済みALiBiベースモデルで見られると報告し、1億4800万パラメータのdecoder事前学習実験を通じて、文脈外劣化とは切り分けて検証した。この失敗はトークン検索を大きく損なう一方、標準的なdecoderベンチマークへの影響は小さいという。
⚡ 今日から使える
ALiBiベースのモデルを学習または評価するなら、passkeyやneedle-in-a-haystackの検索テストを追加し、対数スケールの距離表現を検討すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
MiLMMTチーム、参照訳不要の翻訳モデルを公開
MiLMMT-46-v1.0はGRPOとチェックポイント補間により、オープンな多言語翻訳を改善する。
DistilVDR、視覚文書検索を圧縮
5億2400万パラメータの検索器は、80億パラメータの視覚言語教師モデルから双方向蒸留を行う。
研究者ら、Power Law Graph Attentionを提案
PLGAはscaled dot-product attentionを一般化し、厳密な不変性の下で推論が崩壊すると報告している。