研究人员瞄准 3D VLM 的 token 压缩
ORCA 和 3DZip 旨在无需重新训练模型的情况下,降低 3D CT 与场景 token 的开销。
为什么重要
这项工作针对 3D VLM 的一个现实瓶颈:大规模空间 token 集带来的计算和内存开销。更好的压缩方法可能让医学影像和 3D 场景推理更容易接入语言模型流水线。
核心要点
- 1.ORCA 面向无需改动模型的 3D CT token 压缩。
- 2.3DZip 面向 3D 问答,采用具备空间感知能力的压缩。
- 3.两篇论文都聚焦于降低 3D VLM 的 token 开销。
两篇新论文提出了面向 3D 视觉语言工作负载的 token 压缩方法。在这类任务中,扫描或场景可能产生数千到数万个视觉 token。ORCA 借助器官引导和质心编码来压缩 3D CT token,并被描述为无需训练、即插即用。3DZip 则通过体素化、特征多样的锚点选择以及受空间约束的合并来压缩 3D 场景 token;实验显示,它在三个 3D 问答基准上的表现强于现有压缩方法。
⚡ 今天就能用
在构建需要将大量 CT 或场景 token 输入 LLM 的 3D VLM 系统之前,先评估 ORCA 或 3DZip。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token CompressionAug 4, 12:00 PM↗
- arXiv cs.LG3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 4, 12:00 PM↗
- HF Daily Papers3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 2, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。