Forscher nehmen Token-Kosten in Video- und omni-modalen LLMs ins Visier
Sechs neue Papers schlagen Pruning- oder Kompressionsmethoden für Video-, visuelle und audiovisuell-visuelle Modell-Token vor.
Warum es wichtig ist
Lange Video- und omni-modale Eingaben können Inferenz teuer machen, weil die Zahl der Token mit räumlicher, zeitlicher und modaler Abdeckung wächst. Die Papers verweisen auf eine gemeinsame Forschungsrichtung: aufgabenrelevante Evidenz zu erhalten und zugleich redundante Token vor oder während der LLM-Verarbeitung zu reduzieren.
Die Kernpunkte
- 1.Forscher bekämpfen die Kosten multimodaler Inferenz mit Token-Pruning, Token-Merging und Codebooks.
- 2.Mehrere Methoden betonen globalen Kontext statt rein lokaler Salienzentscheidungen.
- 3.OCR-lastige und Audio-Video-Aufgaben benötigen möglicherweise aufgaben- oder modalitätsbewusste Token-Budgets.
Eine Reihe neuer Forschungsarbeiten stellt Ansätze vor, um die Inferenzkosten von Video- und multimodalen Large Language Models zu senken, indem redundante visuelle und audiovisuell-visuelle Token beschnitten, zusammengeführt oder anderweitig komprimiert werden. Zu den Methoden gehören GSTEP für globales räumlich-zeitliches Video-Token-Pruning, CRAFT für rekursive adaptive Fusion, ONCE für ein offline erstelltes globales Codebook, Macer für omni-modale Kompression mit Modalitätsbudget, ET-Prune für evidenzbewusstes Pruning textreicher visueller Inhalte und OmniPack für einheitliche omni-modale Kompression. Mehrere Papers beschreiben Plug-in- oder trainingsfreie Ansätze, während CRAFT lernbare Fusionskomponenten enthält.
⚡ Heute ausprobieren
Vor dem Einsatz von Workflows für lange Videos oder omni-modale Inhalte sollten Token-Kompressionsmethoden gegen die jeweiligen Zielaufgaben benchmarked werden, besonders bei OCR-lastigen oder Audio-Video-Szenarien.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MiLMMT-Team veröffentlicht referenzfreie Übersetzungsmodelle
MiLMMT-46-v1.0 nutzt GRPO und Checkpoint-Interpolation, um offene mehrsprachige Übersetzung zu verbessern.
DistilVDR komprimiert die visuelle Dokumentensuche
Der Retriever mit 524 Millionen Parametern nutzt bilaterale Destillation von einem 8B-Vision-Language-Lehrmodell.
Forscher schlagen Power Law Graph Attention vor
PLGA verallgemeinert Scaled Dot-Product Attention und berichtet von Inferenz-Kollaps unter exakter Invarianz.