Investigadores apuntan a la compresión de tokens para VLM 3D
ORCA y 3DZip buscan reducir la sobrecarga de tokens en CT 3D y escenas sin reentrenar modelos.
Por qué importa
El trabajo aborda un cuello de botella práctico para los VLM 3D: la sobrecarga de cómputo y memoria causada por grandes conjuntos de tokens espaciales. Una mejor compresión podría hacer que la imagen médica y el razonamiento sobre escenas 3D sean más manejables para los flujos basados en modelos de lenguaje.
Puntos clave
- 1.ORCA apunta a la compresión de tokens de CT 3D sin cambios en el modelo.
- 2.3DZip se enfoca en preguntas y respuestas 3D con compresión consciente del espacio.
- 3.Ambos artículos se centran en reducir la sobrecarga de tokens en VLM 3D.
Dos nuevos artículos proponen métodos de compresión de tokens para cargas de trabajo de visión-lenguaje en 3D, donde los escaneos o las escenas pueden generar desde miles hasta decenas de miles de tokens visuales. ORCA comprime tokens de CT 3D usando guía de órganos y codificación de centroides, y se presenta como una solución sin entrenamiento y plug-and-play. 3DZip comprime tokens de escenas 3D mediante voxelización, selección de anclas con diversidad de características y fusión con restricciones espaciales, con experimentos que reportan mejores resultados que los métodos de compresión existentes en tres benchmarks de preguntas y respuestas 3D.
⚡ Pruébalo hoy
Revise ORCA o 3DZip antes de construir sistemas VLM 3D que pasen grandes conjuntos de tokens de CT o de escenas a un LLM.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token CompressionAug 4, 12:00 PM↗
- arXiv cs.LG3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 4, 12:00 PM↗
- HF Daily Papers3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 2, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.