Des chercheurs s’attaquent au coût des tokens dans les LLM vidéo et omnimodaux
Six nouveaux articles proposent des méthodes d’élagage ou de compression des tokens pour les modèles vidéo, visuels et audio-visuels.
Pourquoi c'est important
Les entrées vidéo longues et omnimodales peuvent rendre l’inférence coûteuse, car le nombre de tokens augmente avec la couverture spatiale, temporelle et modale. Ces articles mettent en évidence une direction de recherche commune : préserver les éléments pertinents pour la tâche tout en supprimant les tokens redondants avant ou pendant le traitement par le LLM.
Points clés
- 1.Les chercheurs cherchent à réduire le coût de l’inférence multimodale grâce à l’élagage, à la fusion et aux codebooks de tokens.
- 2.Plusieurs méthodes privilégient le contexte global plutôt que des décisions de saillance purement locales.
- 3.Les tâches fortement dépendantes de l’OCR et les cas audio-vidéo peuvent nécessiter des budgets de tokens adaptés à la tâche ou à la modalité.
Une série de nouveaux articles de recherche propose des moyens de réduire le coût d’inférence des grands modèles de langage vidéo et multimodaux en élaguant, fusionnant ou compressant autrement les tokens visuels et audio-visuels redondants. Parmi les méthodes figurent GSTEP pour l’élagage global spatio-temporel des tokens vidéo, CRAFT pour la fusion adaptative récursive, ONCE pour un codebook global hors ligne, Macer pour la compression omnimodale avec budget par modalité, ET-Prune pour l’élagage visuel riche en texte et sensible aux preuves, et OmniPack pour une compression omnimodale unifiée. Plusieurs articles décrivent des approches modulaires ou sans entraînement, tandis que CRAFT intègre des composants de fusion apprenables.
⚡ À tester aujourd'hui
Avant de déployer des workflows de vidéo longue ou omnimodaux, évaluez les méthodes de compression de tokens sur vos tâches cibles, en particulier pour les cas fortement dépendants de l’OCR ou combinant audio et vidéo.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.