Des chercheurs s’attaquent à l’inefficacité des MoE dans les modèles de langage à diffusion
De nouveaux articles proposent des correctifs de routage et d’allocation du calcul, alors que LLaDA MoE v2 teste le passage à l’échelle.
Pourquoi c'est important
Ces travaux suggèrent que les techniques MoE issues des LLM autorégressifs ne se transposent pas directement aux modèles de langage à diffusion. Un meilleur routage et une meilleure allocation du calcul pourraient rendre les modèles de génération de texte parallèles plus pratiques pour les cas d’usage à fort débit ou sensibles à la latence.
Points clés
- 1.Les LM à diffusion MoE se heurtent à un décalage entre les besoins du débruitage et des budgets d’experts fixes.
- 2.REFLEX réalloue le calcul à l’inférence sans réentraînement ni remplacement du routeur par défaut.
- 3.LLaDA MoE v2 présente des résultats de passage à l’échelle pour un modèle MoE à diffusion 30B-A3B.
Plusieurs articles nouveaux ou mis à jour examinent la manière dont les systèmes de mixture-of-experts doivent être adaptés aux modèles de langage à diffusion, qui génèrent du texte par débruitage itératif plutôt que par décodage autorégressif. REFLEX propose une méthode d’inférence sans entraînement qui réalloue le calcul des experts autour des états de raffinement des tokens, tout en conservant le routeur par défaut. Des travaux connexes soutiennent que le routage par choix d’expert, une capacité dépendante du pas de temps et l’activation des experts guidée par la cohérence peuvent améliorer l’équilibrage de charge, la convergence ou l’efficacité de l’inférence, tandis que LLaDA MoE v2 présente des résultats de passage à l’échelle issus d’un modèle MoE à diffusion 30B-A3B entraîné sur 23,5T tokens.
⚡ À tester aujourd'hui
Si vous évaluez des LM à diffusion, testez les stratégies de routage et d’allocation des experts séparément des hypothèses propres aux MoE autorégressifs.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AILLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AIREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.LGExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.CLTEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model AccelerationAug 4, 12:00 PM↗
- arXiv cs.CLREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- HF Daily PapersLLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.