AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Des chercheurs s’attaquent à l’inefficacité des MoE dans les modèles de langage à diffusion

De nouveaux articles proposent des correctifs de routage et d’allocation du calcul, alors que LLaDA MoE v2 teste le passage à l’échelle.

Pourquoi c'est important

Ces travaux suggèrent que les techniques MoE issues des LLM autorégressifs ne se transposent pas directement aux modèles de langage à diffusion. Un meilleur routage et une meilleure allocation du calcul pourraient rendre les modèles de génération de texte parallèles plus pratiques pour les cas d’usage à fort débit ou sensibles à la latence.

Points clés

  • 1.Les LM à diffusion MoE se heurtent à un décalage entre les besoins du débruitage et des budgets d’experts fixes.
  • 2.REFLEX réalloue le calcul à l’inférence sans réentraînement ni remplacement du routeur par défaut.
  • 3.LLaDA MoE v2 présente des résultats de passage à l’échelle pour un modèle MoE à diffusion 30B-A3B.

Plusieurs articles nouveaux ou mis à jour examinent la manière dont les systèmes de mixture-of-experts doivent être adaptés aux modèles de langage à diffusion, qui génèrent du texte par débruitage itératif plutôt que par décodage autorégressif. REFLEX propose une méthode d’inférence sans entraînement qui réalloue le calcul des experts autour des états de raffinement des tokens, tout en conservant le routeur par défaut. Des travaux connexes soutiennent que le routage par choix d’expert, une capacité dépendante du pas de temps et l’activation des experts guidée par la cohérence peuvent améliorer l’équilibrage de charge, la convergence ou l’efficacité de l’inférence, tandis que LLaDA MoE v2 présente des résultats de passage à l’échelle issus d’un modèle MoE à diffusion 30B-A3B entraîné sur 23,5T tokens.

À tester aujourd'hui

Si vous évaluez des LM à diffusion, testez les stratégies de routage et d’allocation des experts séparément des hypothèses propres aux MoE autorégressifs.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche