Des chercheurs s’attaquent à la latence des MoE en vision et en décodage
De nouveaux articles proposent des encodeurs visuels MoE, un décodage plus rapide en petits lots et un équilibrage de charge en ligne.
Pourquoi c'est important
Ces travaux reflètent un déplacement de l’objectif, qui ne consiste plus seulement à augmenter la capacité des MoE, mais aussi à réduire les goulets d’étranglement liés à la latence dans des contextes de déploiement réels. S’ils sont validés au-delà des expériences publiées, ces méthodes pourraient avoir un impact sur les modèles vision-langage, les assistants de codage et les systèmes audio-vidéo en temps réel.
Points clés
- 1.MoE-ViE vise une compréhension plus efficace des images et des vidéos.
- 2.DeaMoE s’attaque aux goulets d’étranglement liés au chargement des poids des experts dans le décodage en petits lots.
- 3.FreeBalance fait chevaucher la migration des experts avec des étapes de calcul antérieures.
Plusieurs nouveaux articles de recherche cherchent à rendre les modèles mixture-of-experts plus efficaces lors de l’inférence et pour la compréhension multimodale. MoE-ViE étudie des architectures MoE pour des encodeurs visuels de type CLIP et indique que des topologies à granularité fine surpassent les modèles denses et les versions MoE standard, son plus grand modèle égalant un encodeur de pointe 1,7 fois plus volumineux avec 76 % de sa latence. DeaMoE propose des experts groupés avec des paramètres partagés et privés afin d’accélérer le décodage en petits lots, tandis que FreeBalance propose un équilibrage de charge en ligne avant routage, en prédisant les charges de travail résiduelles avant que les décisions de routage ne soient disponibles.
⚡ À tester aujourd'hui
Examinez ces articles avant de choisir des architectures MoE pour des systèmes d’inférence multimodale à faible latence ou en petits lots.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- HF Daily PapersMoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video UnderstandingAug 18, 4:00 AM↗
- arXiv cs.AIDeaMoE: Efficient MoE Structure for Fast Small-Batch DecodingAug 17, 12:00 PM↗
- arXiv cs.AIFreeBalance: Pre-Routing Online Moe Load Balancing via Residual Workload PredictionAug 17, 12:00 PM↗
- arXiv cs.LGFreeBalance: Pre-Routing Online Moe Load Balancing via Residual Workload PredictionAug 17, 12:00 PM↗
- arXiv cs.LGDeaMoE: Efficient MoE Structure for Fast Small-Batch DecodingAug 17, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.