Des chercheurs ciblent la compression de tokens pour les VLM 3D
ORCA et 3DZip cherchent à réduire le surcoût des tokens issus de CT 3D et de scènes, sans réentraîner les modèles.
Pourquoi c'est important
Ces travaux s’attaquent à un goulot d’étranglement concret pour les VLM 3D : le coût en calcul et en mémoire lié aux grands ensembles de tokens spatiaux. Une meilleure compression pourrait rendre l’imagerie médicale et le raisonnement sur des scènes 3D plus faciles à intégrer dans des pipelines de modèles de langage.
Points clés
- 1.ORCA vise la compression de tokens de CT 3D sans modifier le modèle.
- 2.3DZip cible les questions-réponses 3D avec une compression tenant compte de l’espace.
- 3.Les deux articles se concentrent sur la réduction du surcoût en tokens des VLM 3D.
Deux nouveaux articles proposent des méthodes de compression de tokens pour les charges de travail vision-langage en 3D, où les scans ou les scènes peuvent générer des milliers, voire des dizaines de milliers, de tokens visuels. ORCA compresse les tokens de CT 3D à l’aide d’un guidage par organe et d’un encodage par centroïdes, et se présente comme une solution sans entraînement et prête à l’emploi. 3DZip compresse les tokens de scènes 3D via la voxelisation, la sélection d’ancres aux caractéristiques diversifiées et une fusion spatialement contrainte, avec des expériences faisant état de meilleurs résultats que les méthodes de compression existantes sur trois benchmarks de questions-réponses 3D.
⚡ À tester aujourd'hui
Examinez ORCA ou 3DZip avant de construire des systèmes VLM 3D qui transmettent à un LLM de grands ensembles de tokens issus de CT ou de scènes.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token CompressionAug 4, 12:00 PM↗
- arXiv cs.LG3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 4, 12:00 PM↗
- HF Daily Papers3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question AnsweringAug 2, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.