AAI News Hub
研究Tue, August 4, 2026·Aug 42 sources corroborating

研究者ら、拡散型言語モデルにおけるMoEの非効率性に照準

新たな論文群がルーティングと計算資源配分の改善策を提案。LLaDA MoE v2はスケーリングを検証。

なぜ重要か

これらの研究は、自己回帰型LLMで使われてきたMoE技術が、拡散型言語モデルにはそのまま移植できないことを示唆している。ルーティングと計算資源配分を改善できれば、並列テキスト生成モデルは、高スループットや低レイテンシが求められる用途でより実用的になり得る。

要点

  • 1.MoE拡散型LMでは、ノイズ除去の要求と固定されたエキスパート予算の間にミスマッチがある。
  • 2.REFLEXは、再学習やデフォルトルーターの置き換えなしに、推論時の計算資源を再配分する。
  • 3.LLaDA MoE v2は、30B-A3Bの拡散MoEモデルについてスケーリング結果を報告している。

複数の新規・更新論文が、自己回帰型デコーディングではなく反復的なノイズ除去によってテキストを生成する拡散型言語モデルに、mixture-of-experts(MoE)システムをどう適応させるべきかを検討している。REFLEXは、デフォルトのルーターを変更せず、トークンの精緻化状態に応じてエキスパート計算を再配分する、学習不要の推論手法を提案する。関連研究では、expert-choice routing、タイムステップ依存の容量設定、一貫性に基づくエキスパート活性化が、負荷分散、収束、推論効率を改善し得ると論じている。一方、LLaDA MoE v2は、23.5Tトークンで学習した30B-A3Bの拡散MoEモデルについてスケーリング結果を報告している。

今日から使える

拡散型LMを評価する場合は、自己回帰型MoEの前提とは切り離して、ルーティングとエキスパート配分の戦略を個別にベンチマークすべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究