Investigadores apuntan a la ineficiencia de MoE en modelos de lenguaje de difusión
Nuevos artículos proponen ajustes de enrutamiento y asignación de cómputo mientras LLaDA MoE v2 prueba el escalado.
Por qué importa
El trabajo sugiere que las técnicas MoE de los LLM autoregresivos no se trasladan limpiamente a los modelos de lenguaje de difusión. Un mejor enrutamiento y una mejor asignación de cómputo podrían hacer que los modelos de generación de texto en paralelo sean más prácticos para casos de uso de alto rendimiento o sensibles a la latencia.
Puntos clave
- 1.Los LMs de difusión MoE enfrentan un desajuste entre las demandas de eliminación de ruido y presupuestos fijos de expertos.
- 2.REFLEX reasigna el cómputo de inferencia sin reentrenar ni sustituir el router predeterminado.
- 3.LLaDA MoE v2 informa resultados de escalado para un modelo diffusion MoE 30B-A3B.
Varios artículos nuevos y actualizados examinan cómo deberían adaptarse los sistemas mixture-of-experts a los modelos de lenguaje de difusión, que generan texto mediante eliminación iterativa de ruido en lugar de decodificación autoregresiva. REFLEX propone un método de inferencia sin entrenamiento que reasigna el cómputo de expertos en torno a los estados de refinamiento de tokens, manteniendo sin cambios el router predeterminado. Trabajos relacionados sostienen que el enrutamiento expert-choice, la capacidad dependiente del timestep y la activación de expertos guiada por consistencia pueden mejorar el balanceo de carga, la convergencia o la eficiencia de inferencia, mientras LLaDA MoE v2 presenta hallazgos de escalado de un modelo diffusion MoE 30B-A3B entrenado con 23,5T tokens.
⚡ Pruébalo hoy
Si evalúas LMs de difusión, mide las estrategias de enrutamiento y asignación de expertos por separado de los supuestos de MoE autoregresivos.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AILLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AIREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.LGExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.CLTEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model AccelerationAug 4, 12:00 PM↗
- arXiv cs.CLREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- HF Daily PapersLLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Investigadores proponen Power Law Graph Attention
PLGA generaliza la atención de producto punto escalado y reporta colapso de inferencia bajo invariancia exacta.