연구진, 확산 언어 모델의 MoE 비효율성 정조준
새 논문들이 라우팅과 연산 배분 개선책을 제안하는 가운데, LLaDA MoE v2는 스케일링을 시험했다.
왜 중요한가
이 연구들은 자기회귀 LLM의 MoE 기법이 확산 언어 모델로 깔끔하게 이전되지 않는다는 점을 시사한다. 더 나은 라우팅과 연산 배분은 병렬 텍스트 생성 모델을 높은 처리량이나 낮은 지연 시간이 중요한 사용 사례에서 더 실용적으로 만들 수 있다.
핵심 포인트
- 1.MoE 확산 LM은 노이즈 제거 요구와 고정된 expert 예산 사이의 불일치에 직면해 있다.
- 2.REFLEX는 재학습이나 기본 라우터 교체 없이 추론 연산을 재배분한다.
- 3.LLaDA MoE v2는 30B-A3B 확산 MoE 모델의 스케일링 결과를 보고했다.
여러 신규 및 업데이트 논문이 자기회귀 디코딩이 아니라 반복적 노이즈 제거를 통해 텍스트를 생성하는 확산 언어 모델에 mixture-of-experts 시스템을 어떻게 맞춰야 하는지 살펴봤다. REFLEX는 기본 라우터를 그대로 유지하면서 토큰 정제 상태에 맞춰 expert 연산을 재배분하는 학습 없는 추론 방법을 제안한다. 관련 연구들은 expert-choice 라우팅, timestep 의존적 용량, 일관성 기반 expert 활성화가 로드 밸런싱, 수렴 또는 추론 효율을 개선할 수 있다고 주장한다. 한편 LLaDA MoE v2는 23.5T 토큰으로 학습한 30B-A3B 확산 MoE 모델의 스케일링 결과를 보고했다.
⚡ 오늘 바로 활용
확산 LM을 평가한다면, 자기회귀 MoE의 가정과 별개로 라우팅 및 expert 배분 전략을 벤치마크해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AILLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AIREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.LGA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.LGExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLExpert-Choice Routing Enables Adaptive Computation in Diffusion Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLA Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMsAug 4, 12:00 PM↗
- arXiv cs.CLTEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model AccelerationAug 4, 12:00 PM↗
- arXiv cs.CLREFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language ModelsAug 4, 12:00 PM↗
- HF Daily PapersLLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsAug 4, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.