AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

Pesquisadores miram ineficiências de MoE em modelos de linguagem por difusão

Novos artigos propõem ajustes de roteamento e alocação de computação enquanto o LLaDA MoE v2 testa escalabilidade.

Por que importa

O trabalho sugere que técnicas de MoE vindas de LLMs autorregressivos não se transferem diretamente para modelos de linguagem por difusão. Melhor roteamento e melhor alocação de computação podem tornar modelos de geração de texto paralela mais práticos para casos de uso de alto throughput ou sensíveis à latência.

Pontos-chave

  • 1.LMs de difusão com MoE enfrentam um descompasso entre as demandas de denoising e orçamentos fixos de especialistas.
  • 2.O REFLEX realoca computação na inferência sem retreinamento nem substituição do roteador padrão.
  • 3.O LLaDA MoE v2 relata resultados de escalabilidade para um modelo diffusion MoE 30B-A3B.

Vários artigos novos e atualizados analisam como sistemas mixture-of-experts devem ser adaptados para modelos de linguagem por difusão, que geram texto por denoising iterativo em vez de decodificação autorregressiva. O REFLEX propõe um método de inferência sem treinamento que realoca a computação dos especialistas em torno dos estados de refinamento dos tokens, mantendo inalterado o roteador padrão. Trabalhos relacionados argumentam que roteamento por escolha de especialistas, capacidade dependente do timestep e ativação de especialistas guiada por consistência podem melhorar o balanceamento de carga, a convergência ou a eficiência de inferência, enquanto o LLaDA MoE v2 relata achados de escalabilidade de um modelo diffusion MoE 30B-A3B treinado em 23,5T tokens.

Experimente hoje

Ao avaliar LMs por difusão, faça benchmarks das estratégias de roteamento e alocação de especialistas separadamente das premissas de MoE autorregressivo.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa