Pesquisadores miram compressão de tokens para VLMs 3D
ORCA e 3DZip buscam reduzir a sobrecarga de tokens em CTs 3D e cenas sem retreinar modelos.
Por que importa
O trabalho enfrenta um gargalo prático para VLMs 3D: a sobrecarga de computação e memória gerada por grandes conjuntos de tokens espaciais. Uma compressão melhor pode tornar imagens médicas e raciocínio sobre cenas 3D mais viáveis em pipelines com modelos de linguagem.
Pontos-chave
- 1.O ORCA mira a compressão de tokens de CT 3D sem mudanças no modelo.
- 2.O 3DZip mira perguntas e respostas em 3D com compressão consciente do espaço.
- 3.Ambos os artigos se concentram em reduzir a sobrecarga de tokens em VLMs 3D.
Dois novos artigos propõem métodos de compressão de tokens para cargas de trabalho de visão-linguagem em 3D, nas quais exames ou cenas podem gerar de milhares a dezenas de milhares de tokens visuais. O ORCA comprime tokens de CT 3D usando orientação por órgãos e codificação por centróides, e é descrito como livre de treinamento e plug-and-play. O 3DZip comprime tokens de cenas 3D por meio de voxelização, seleção de âncoras com diversidade de atributos e mesclagem com restrição espacial, com experimentos indicando resultados mais fortes do que os de métodos de compressão existentes em três benchmarks de perguntas e respostas em 3D.
⚡ Experimente hoje
Analise o ORCA ou o 3DZip antes de criar sistemas de VLM 3D que enviem grandes conjuntos de tokens de CT ou de cenas para um LLM.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token CompressionAug 4, 12:00 PM↗
- arXiv cs.LG3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 4, 12:00 PM↗
- HF Daily Papers3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 2, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.