AAI News Hub
연구Tue, August 4, 2026·Aug 42 sources corroborating

연구진, 확산 언어 모델의 MoE 비효율성 정조준

새 논문들이 라우팅과 연산 배분 개선책을 제안하는 가운데, LLaDA MoE v2는 스케일링을 시험했다.

왜 중요한가

이 연구들은 자기회귀 LLM의 MoE 기법이 확산 언어 모델로 깔끔하게 이전되지 않는다는 점을 시사한다. 더 나은 라우팅과 연산 배분은 병렬 텍스트 생성 모델을 높은 처리량이나 낮은 지연 시간이 중요한 사용 사례에서 더 실용적으로 만들 수 있다.

핵심 포인트

  • 1.MoE 확산 LM은 노이즈 제거 요구와 고정된 expert 예산 사이의 불일치에 직면해 있다.
  • 2.REFLEX는 재학습이나 기본 라우터 교체 없이 추론 연산을 재배분한다.
  • 3.LLaDA MoE v2는 30B-A3B 확산 MoE 모델의 스케일링 결과를 보고했다.

여러 신규 및 업데이트 논문이 자기회귀 디코딩이 아니라 반복적 노이즈 제거를 통해 텍스트를 생성하는 확산 언어 모델에 mixture-of-experts 시스템을 어떻게 맞춰야 하는지 살펴봤다. REFLEX는 기본 라우터를 그대로 유지하면서 토큰 정제 상태에 맞춰 expert 연산을 재배분하는 학습 없는 추론 방법을 제안한다. 관련 연구들은 expert-choice 라우팅, timestep 의존적 용량, 일관성 기반 expert 활성화가 로드 밸런싱, 수렴 또는 추론 효율을 개선할 수 있다고 주장한다. 한편 LLaDA MoE v2는 23.5T 토큰으로 학습한 30B-A3B 확산 MoE 모델의 스케일링 결과를 보고했다.

오늘 바로 활용

확산 LM을 평가한다면, 자기회귀 MoE의 가정과 별개로 라우팅 및 expert 배분 전략을 벤치마크해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구