AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Des chercheurs s’attaquent au coût des tokens dans les LLM vidéo et omnimodaux

Six nouveaux articles proposent des méthodes d’élagage ou de compression des tokens pour les modèles vidéo, visuels et audio-visuels.

Pourquoi c'est important

Les entrées vidéo longues et omnimodales peuvent rendre l’inférence coûteuse, car le nombre de tokens augmente avec la couverture spatiale, temporelle et modale. Ces articles mettent en évidence une direction de recherche commune : préserver les éléments pertinents pour la tâche tout en supprimant les tokens redondants avant ou pendant le traitement par le LLM.

Points clés

  • 1.Les chercheurs cherchent à réduire le coût de l’inférence multimodale grâce à l’élagage, à la fusion et aux codebooks de tokens.
  • 2.Plusieurs méthodes privilégient le contexte global plutôt que des décisions de saillance purement locales.
  • 3.Les tâches fortement dépendantes de l’OCR et les cas audio-vidéo peuvent nécessiter des budgets de tokens adaptés à la tâche ou à la modalité.

Une série de nouveaux articles de recherche propose des moyens de réduire le coût d’inférence des grands modèles de langage vidéo et multimodaux en élaguant, fusionnant ou compressant autrement les tokens visuels et audio-visuels redondants. Parmi les méthodes figurent GSTEP pour l’élagage global spatio-temporel des tokens vidéo, CRAFT pour la fusion adaptative récursive, ONCE pour un codebook global hors ligne, Macer pour la compression omnimodale avec budget par modalité, ET-Prune pour l’élagage visuel riche en texte et sensible aux preuves, et OmniPack pour une compression omnimodale unifiée. Plusieurs articles décrivent des approches modulaires ou sans entraînement, tandis que CRAFT intègre des composants de fusion apprenables.

À tester aujourd'hui

Avant de déployer des workflows de vidéo longue ou omnimodaux, évaluez les méthodes de compression de tokens sur vos tâches cibles, en particulier pour les cas fortement dépendants de l’OCR ou combinant audio et vidéo.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche