AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

研究人员瞄准 3D VLM 的 token 压缩

ORCA 和 3DZip 旨在无需重新训练模型的情况下,降低 3D CT 与场景 token 的开销。

为什么重要

这项工作针对 3D VLM 的一个现实瓶颈:大规模空间 token 集带来的计算和内存开销。更好的压缩方法可能让医学影像和 3D 场景推理更容易接入语言模型流水线。

核心要点

  • 1.ORCA 面向无需改动模型的 3D CT token 压缩。
  • 2.3DZip 面向 3D 问答,采用具备空间感知能力的压缩。
  • 3.两篇论文都聚焦于降低 3D VLM 的 token 开销。

两篇新论文提出了面向 3D 视觉语言工作负载的 token 压缩方法。在这类任务中,扫描或场景可能产生数千到数万个视觉 token。ORCA 借助器官引导和质心编码来压缩 3D CT token,并被描述为无需训练、即插即用。3DZip 则通过体素化、特征多样的锚点选择以及受空间约束的合并来压缩 3D 场景 token;实验显示,它在三个 3D 问答基准上的表现强于现有压缩方法。

今天就能用

在构建需要将大量 CT 或场景 token 输入 LLM 的 3D VLM 系统之前,先评估 ORCA 或 3DZip。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究