연구진, 비디오 및 옴니모달 LLM의 토큰 비용 절감에 주목
새 논문들이 멀티모달 추론 오버헤드를 줄이기 위한 프루닝 및 압축 방법을 제안했다.
왜 중요한가
토큰 규모는 장시간 비디오와 옴니모달 추론의 주요 비용 요인이다. 이러한 접근법은 이 분야가 일반적인 top-K 프루닝에서 과제, 모달리티, 구조를 고려한 압축으로 이동하고 있음을 보여준다.
핵심 포인트
- 1.연구진은 새로운 프루닝, 융합, 코드북 기반 토큰 압축 방법을 제안했다.
- 2.여러 방법은 세그먼트 단위나 top-K 프루닝이 아니라 전역 맥락을 겨냥한다.
- 3.보고된 성과는 벤치마크 정확도를 유지하면서 토큰 비용을 낮추는 데 초점을 맞춘다.
최근 발표된 6편의 논문은 멀티모달 대규모 언어 모델에서 시각, 오디오, 비디오 토큰 부담을 줄이는 방안을 제시했다. 방법론에는 전역 시공간 비디오 프루닝, 재귀적 토큰 융합, 오프라인 코드북 압축, 명시적 오디오-비디오 예산 배분, 텍스트가 많은 입력을 위한 증거 인식 프루닝, 옴니모달 모델을 위한 사전 압축과 LLM 내부 압축의 조율이 포함된다. 여러 논문은 비디오, OCR 중심, 오디오-비주얼 벤치마크 전반에서 더 적은 토큰을 쓰면서도 정확도를 유지했다고 보고했다.
⚡ 오늘 바로 활용
장시간 비디오 또는 옴니모달 LLM 워크플로를 배포하기 전에, 자체 정확도와 지연시간 목표에 맞춰 토큰 압축 방법을 벤치마크해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.LGDIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language ModelsAug 6, 12:00 PM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AIAdaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language ModelsAug 5, 12:00 PM↗
- arXiv cs.CLGSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language ModelsAug 5, 12:00 PM↗
- arXiv cs.AICRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.AIRethinking Video Token Compression with a Global Codebook: Learning Once, Compressing EverywhereAug 4, 12:00 PM↗
- arXiv cs.AICoverage-Driven Adaptive Keyframe Selection for Video UnderstandingAug 4, 12:00 PM↗
- arXiv cs.AIAllocation Before Ranking: Decoupled Token Compression for OmniLLMsAug 4, 12:00 PM↗
- arXiv cs.LGDAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMsAug 4, 12:00 PM↗
- arXiv cs.CLCAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal GroundingAug 4, 12:00 PM↗
- HF Daily PapersOmniPack: Unified Token Compression for Efficient Omni-modal Large Language ModelsAug 4, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
Google, 동형암호로 프라이빗 AI 진전
Google은 동형암호를 활용해 프라이빗 AI를 더 실용적으로 만들고 있다고 밝혔다.
Hacker News+8 outlets·10h ago
연구
Google, private AI를 실용화하고 있다고 밝혀
Google Security 게시물이 Hacker News에서 논의를 불러왔고, 더 넓은 AI 비판과도 맞물렸다.
Hacker News+5 outlets·10h ago
연구
연구진, 통제된 LLM 연구용 LittleLearner 공개
50억 개 파라미터 모델로, 초등학교 5학년 이하 수준의 커리큘럼 말뭉치 880억 토큰으로 학습됐다.
r/LocalLLaMA+1 outlet·15h ago