動画・オムニモーダルLLMのトークンコスト削減に研究が集中
新たな論文群が、マルチモーダル推論の負荷を抑えるための枝刈り・圧縮手法を提案。
なぜ重要か
長尺動画やオムニモーダル推論では、トークン量がコストを大きく左右する。これらの手法は、分野が汎用的なtop-K枝刈りから、タスク、モダリティ、構造を意識した圧縮へ移りつつあることを示している。
要点
- 1.研究者らは、枝刈り、融合、コードブックに基づく新たなトークン圧縮手法を提案している。
- 2.複数の手法は、セグメント単位やtop-Kの枝刈りにとどまらず、グローバルな文脈を対象にしている。
- 3.報告された成果は、ベンチマーク精度を維持しながらトークンコストを下げる点に焦点を当てている。
最近発表された6本の論文が、マルチモーダル大規模言語モデルにおける画像、音声、動画のトークン負荷を減らす手法を示した。提案されているのは、動画全体を対象にした時空間的な枝刈り、再帰的なトークン融合、オフラインのコードブック圧縮、音声・動画間の明示的な予算配分、テキスト量の多い入力に対するエビデンス認識型の枝刈り、そしてオムニモーダルモデル向けのLLM投入前と内部での協調的圧縮などだ。複数の論文は、動画、OCR中心、音声・視覚ベンチマークで、使用トークン数を減らしながら精度を維持できたと報告している。
⚡ 今日から使える
長尺動画やオムニモーダルLLMのワークフローを本番導入する前に、自社の精度・レイテンシ目標に照らしてトークン圧縮手法をベンチマークすべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、映像の反射除去に向けた拡散モデルを提案
S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。
arXiv cs.AI+1 outlet·6h ago
研究
論文、エージェント安全性には実行時契約が必要と主張
arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。
arXiv cs.AI+1 outlet·6h ago
研究
研究者ら、弱いモデル向けにAIが構築したハーネスを検証
より強力なモデルが推論時の足場を構築し、Theory-of-Mindベンチマークで弱いモデルのスコアを引き上げた。
arXiv cs.AI+1 outlet·6h ago