Investigadores apuntan a reducir el coste de tokens en LLM de vídeo y omnimodales
Seis nuevos trabajos proponen métodos de poda o compresión de tokens para modelos de vídeo, visuales y audiovisuales.
Por qué importa
Las entradas de vídeo largo y omnimodales pueden encarecer la inferencia porque el número de tokens crece con la cobertura espacial, temporal y de modalidades. Los trabajos apuntan a una dirección de investigación común: preservar la evidencia relevante para la tarea mientras se recortan tokens redundantes antes o durante el procesamiento del LLM.
Puntos clave
- 1.Los investigadores están abordando el coste de la inferencia multimodal mediante poda, fusión y codebooks de tokens.
- 2.Varios métodos dan prioridad al contexto global frente a decisiones de saliencia puramente locales.
- 3.Las tareas con mucho OCR y las audiovisuales pueden requerir presupuestos de tokens adaptados a la tarea o a la modalidad.
Un conjunto de nuevos trabajos de investigación propone formas de reducir el coste de inferencia de los grandes modelos de lenguaje de vídeo y multimodales mediante la poda, fusión u otras formas de compresión de tokens visuales y audiovisuales redundantes. Los métodos incluyen GSTEP para la poda global de tokens de vídeo espaciotemporales, CRAFT para la fusión adaptativa recursiva, ONCE para un codebook global offline, Macer para la compresión omnimodal con presupuesto por modalidad, ET-Prune para la poda visual con abundante texto y consciente de la evidencia, y OmniPack para la compresión omnimodal unificada. Varios trabajos describen enfoques plug-in o sin entrenamiento, mientras que CRAFT incluye componentes de fusión aprendibles.
⚡ Pruébalo hoy
Antes de desplegar flujos de trabajo con vídeo largo u omnimodales, evalúa los métodos de compresión de tokens frente a tus tareas objetivo, especialmente en casos con mucho OCR o de audio y vídeo.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.