AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

Pesquisadores miram compressão de tokens para VLMs 3D

ORCA e 3DZip buscam reduzir a sobrecarga de tokens em CTs 3D e cenas sem retreinar modelos.

Por que importa

O trabalho enfrenta um gargalo prático para VLMs 3D: a sobrecarga de computação e memória gerada por grandes conjuntos de tokens espaciais. Uma compressão melhor pode tornar imagens médicas e raciocínio sobre cenas 3D mais viáveis em pipelines com modelos de linguagem.

Pontos-chave

  • 1.O ORCA mira a compressão de tokens de CT 3D sem mudanças no modelo.
  • 2.O 3DZip mira perguntas e respostas em 3D com compressão consciente do espaço.
  • 3.Ambos os artigos se concentram em reduzir a sobrecarga de tokens em VLMs 3D.

Dois novos artigos propõem métodos de compressão de tokens para cargas de trabalho de visão-linguagem em 3D, nas quais exames ou cenas podem gerar de milhares a dezenas de milhares de tokens visuais. O ORCA comprime tokens de CT 3D usando orientação por órgãos e codificação por centróides, e é descrito como livre de treinamento e plug-and-play. O 3DZip comprime tokens de cenas 3D por meio de voxelização, seleção de âncoras com diversidade de atributos e mesclagem com restrição espacial, com experimentos indicando resultados mais fortes do que os de métodos de compressão existentes em três benchmarks de perguntas e respostas em 3D.

Experimente hoje

Analise o ORCA ou o 3DZip antes de criar sistemas de VLM 3D que enviem grandes conjuntos de tokens de CT ou de cenas para um LLM.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa