AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

Des chercheurs ciblent la compression de tokens pour les VLM 3D

ORCA et 3DZip cherchent à réduire le surcoût des tokens issus de CT 3D et de scènes, sans réentraîner les modèles.

Pourquoi c'est important

Ces travaux s’attaquent à un goulot d’étranglement concret pour les VLM 3D : le coût en calcul et en mémoire lié aux grands ensembles de tokens spatiaux. Une meilleure compression pourrait rendre l’imagerie médicale et le raisonnement sur des scènes 3D plus faciles à intégrer dans des pipelines de modèles de langage.

Points clés

  • 1.ORCA vise la compression de tokens de CT 3D sans modifier le modèle.
  • 2.3DZip cible les questions-réponses 3D avec une compression tenant compte de l’espace.
  • 3.Les deux articles se concentrent sur la réduction du surcoût en tokens des VLM 3D.

Deux nouveaux articles proposent des méthodes de compression de tokens pour les charges de travail vision-langage en 3D, où les scans ou les scènes peuvent générer des milliers, voire des dizaines de milliers, de tokens visuels. ORCA compresse les tokens de CT 3D à l’aide d’un guidage par organe et d’un encodage par centroïdes, et se présente comme une solution sans entraînement et prête à l’emploi. 3DZip compresse les tokens de scènes 3D via la voxelisation, la sélection d’ancres aux caractéristiques diversifiées et une fusion spatialement contrainte, avec des expériences faisant état de meilleurs résultats que les méthodes de compression existantes sur trois benchmarks de questions-réponses 3D.

À tester aujourd'hui

Examinez ORCA ou 3DZip avant de construire des systèmes VLM 3D qui transmettent à un LLM de grands ensembles de tokens issus de CT ou de scènes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche