Pesquisadores miram custos de tokens em LLMs de vídeo e omni-modais
Seis novos artigos propõem métodos de poda ou compressão de tokens para modelos de vídeo, visuais e audiovisuais.
Por que importa
Entradas longas de vídeo e omni-modais podem tornar a inferência cara porque a contagem de tokens cresce conforme a cobertura espacial, temporal e de modalidades. Os artigos apontam para uma direção comum de pesquisa: preservar evidências relevantes para a tarefa enquanto reduzem tokens redundantes antes ou durante o processamento pelo LLM.
Pontos-chave
- 1.Pesquisadores estão enfrentando o custo da inferência multimodal com poda, fusão e codebooks de tokens.
- 2.Vários métodos enfatizam o contexto global em vez de decisões de saliência puramente locais.
- 3.Tarefas com muito OCR e áudio e vídeo podem exigir orçamentos de tokens ajustados à tarefa ou à modalidade.
Um conjunto de novos artigos de pesquisa propõe formas de reduzir o custo de inferência de grandes modelos de linguagem de vídeo e multimodais por meio de poda, fusão ou outras formas de compressão de tokens visuais e audiovisuais redundantes. Os métodos incluem GSTEP, para poda global de tokens de vídeo espaço-temporais; CRAFT, para fusão adaptativa recursiva; ONCE, para um codebook global offline; Macer, para compressão omni-modal com orçamento por modalidade; ET-Prune, para poda visual rica em texto com consciência de evidências; e OmniPack, para compressão omni-modal unificada. Vários artigos descrevem abordagens plug-in ou sem treinamento, enquanto o CRAFT inclui componentes de fusão aprendíveis.
⚡ Experimente hoje
Antes de implantar fluxos de trabalho com vídeos longos ou entradas omni-modais, compare métodos de compressão de tokens nas suas tarefas-alvo, especialmente em casos com muito OCR ou áudio e vídeo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.