AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

Investigadores apuntan a la compresión de tokens para VLM 3D

ORCA y 3DZip buscan reducir la sobrecarga de tokens en CT 3D y escenas sin reentrenar modelos.

Por qué importa

El trabajo aborda un cuello de botella práctico para los VLM 3D: la sobrecarga de cómputo y memoria causada por grandes conjuntos de tokens espaciales. Una mejor compresión podría hacer que la imagen médica y el razonamiento sobre escenas 3D sean más manejables para los flujos basados en modelos de lenguaje.

Puntos clave

  • 1.ORCA apunta a la compresión de tokens de CT 3D sin cambios en el modelo.
  • 2.3DZip se enfoca en preguntas y respuestas 3D con compresión consciente del espacio.
  • 3.Ambos artículos se centran en reducir la sobrecarga de tokens en VLM 3D.

Dos nuevos artículos proponen métodos de compresión de tokens para cargas de trabajo de visión-lenguaje en 3D, donde los escaneos o las escenas pueden generar desde miles hasta decenas de miles de tokens visuales. ORCA comprime tokens de CT 3D usando guía de órganos y codificación de centroides, y se presenta como una solución sin entrenamiento y plug-and-play. 3DZip comprime tokens de escenas 3D mediante voxelización, selección de anclas con diversidad de características y fusión con restricciones espaciales, con experimentos que reportan mejores resultados que los métodos de compresión existentes en tres benchmarks de preguntas y respuestas 3D.

Pruébalo hoy

Revise ORCA o 3DZip antes de construir sistemas VLM 3D que pasen grandes conjuntos de tokens de CT o de escenas a un LLM.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación