ARCHead vise la compression des têtes de sortie des LLM
La méthode compresse le stockage des têtes LM sans conserver de tête dense en BF16, selon un nouvel article publié sur arXiv.
Pourquoi c'est important
Les têtes de sortie restent souvent en BF16 ou FP16 même lorsque les blocs transformer sont quantifiés, ce qui laisse un écart de stockage dans les déploiements pratiques. ARCHead pourrait réduire la taille des LLM quantifiés en poids uniquement en s’attaquant à cette dernière couche de projection.
Points clés
- 1.Compresse le stockage des têtes LM d’un facteur 3,7 à 3,9.
- 2.N’utilise que 25,6 % du stockage d’une tête BF16 sur Qwen3-8B-Base.
- 3.Ajoute une variation du débit inférieure à 2 % dans les tests rapportés.
Des chercheurs ont présenté ARCHead, un compresseur compact pour les têtes de sortie des grands modèles de langage, qui combine un noyau bas rang quantifié, des résidus INT4 par groupes et une correction bas rang ajustée selon une métrique dérivée des activations. Selon l’article, ARCHead réduit le stockage persistant des têtes LM d’un facteur 3,7 à 3,9 et, sur Qwen3-8B-Base, n’utilise que 25,6 % du stockage d’une tête BF16 tout en atteignant une perplexité relative de 1,007. Le remplacement de la tête BF16 laissée par AWQ ou bitsandbytes a ajouté 0,006 à 0,007 d’entropie croisée, avec une variation du débit inférieure à 2 % dans les mesures des auteurs.
⚡ À tester aujourd'hui
Si vous déployez des modèles quantifiés avec AWQ ou bitsandbytes, examinez le code d’ARCHead et testez la compression des têtes de sortie sur votre modèle cible avant de continuer à vous appuyer sur des têtes BF16.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.CLARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- arXiv cs.LGARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- HF Daily PapersARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 3, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.