AAI News Hub
RechercheTue, August 18, 2026·2d ago

MoE-ViE vise une mise à l’échelle plus efficace des encodeurs visuels

L’article étudie des architectures MoE pour des encodeurs visuels de type CLIP destinés à la compréhension des images et des vidéos.

Pourquoi c'est important

L’article suggère que la mise à l’échelle MoE peut améliorer les encodeurs visuels de type CLIP, un domaine moins exploré que les modèles de langage MoE. Si elle est reproduite, cette approche pourrait aider les systèmes vision-langage à augmenter leur capacité tout en limitant la latence d’inférence.

Points clés

  • 1.Les topologies MoE à granularité fine battent les modèles de référence denses et MoE standards.
  • 2.Un noyau MoE spécialisé est conçu pour réduire le surcoût de latence.
  • 3.La distillation au niveau des images vidéo vise à ajouter des capacités vidéo tout en préservant les connaissances liées aux images.

Des chercheurs ont présenté MoE-ViE, une série d’encodeurs visuels Mixture-of-Experts conçus pour améliorer la compréhension des images et des vidéos sans supporter tout le coût de calcul d’une mise à l’échelle dense. L’étude indique que des topologies MoE à granularité fine surpassent les modèles denses et les MoE standards comparables, avec un équilibrage sans perte auxiliaire, un noyau MoE spécialisé et une distillation au niveau des images vidéo avec gel de paramètres pour les capacités vidéo. Le plus grand modèle atteindrait les performances zero-shot d’un encodeur de pointe 1,7 fois plus grand, avec 76 % de sa latence.

À tester aujourd'hui

Lisez l’article avant de mettre à l’échelle un encodeur visuel dense, surtout si la latence est une contrainte de déploiement.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche