Pesquisadores miram ineficiências de MoE em modelos de linguagem por difusão
Novos artigos propõem ajustes de roteamento e alocação de computação enquanto o LLaDA MoE v2 testa escalabilidade.
Por que importa
O trabalho sugere que técnicas de MoE vindas de LLMs autorregressivos não se transferem diretamente para modelos de linguagem por difusão. Melhor roteamento e melhor alocação de computação podem tornar modelos de geração de texto paralela mais práticos para casos de uso de alto throughput ou sensíveis à latência.
Pontos-chave
- 1.LMs de difusão com MoE enfrentam um descompasso entre as demandas de denoising e orçamentos fixos de especialistas.
- 2.O REFLEX realoca computação na inferência sem retreinamento nem substituição do roteador padrão.
- 3.O LLaDA MoE v2 relata resultados de escalabilidade para um modelo diffusion MoE 30B-A3B.
Vários artigos novos e atualizados analisam como sistemas mixture-of-experts devem ser adaptados para modelos de linguagem por difusão, que geram texto por denoising iterativo em vez de decodificação autorregressiva. O REFLEX propõe um método de inferência sem treinamento que realoca a computação dos especialistas em torno dos estados de refinamento dos tokens, mantendo inalterado o roteador padrão. Trabalhos relacionados argumentam que roteamento por escolha de especialistas, capacidade dependente do timestep e ativação de especialistas guiada por consistência podem melhorar o balanceamento de carga, a convergência ou a eficiência de inferência, enquanto o LLaDA MoE v2 relata achados de escalabilidade de um modelo diffusion MoE 30B-A3B treinado em 23,5T tokens.
⚡ Experimente hoje
Ao avaliar LMs por difusão, faça benchmarks das estratégias de roteamento e alocação de especialistas separadamente das premissas de MoE autorregressivo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AILLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AIREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.LGExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.CLTEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model AccelerationAug 4, 12:00 PM↗
- arXiv cs.CLREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- HF Daily PapersLLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Novos estudos investigam inteligência espacial em IA de visão
SpaRRTa, SMA e PinpointQA testam ou aprimoram o raciocínio espacial em sistemas de IA visual e incorporada.
CW-BASS v2 mira a seleção de pseudo-rótulos com DINOv2
O método adapta a filtragem para segmentação semissupervisionada com professores baseados em modelos de fundação.
Estudo mapeia o uso do ChatGPT Enterprise em organizações
O artigo no arXiv conecta registros de contas empresariais a cargos, tarefas e dados de empresas até março de 2026.