AAI News Hub
RechercheWed, August 5, 2026·Aug 52 sources corroborating

ARCHead vise la compression des têtes de sortie des LLM

La méthode compresse le stockage des têtes LM sans conserver de tête dense en BF16, selon un nouvel article publié sur arXiv.

Pourquoi c'est important

Les têtes de sortie restent souvent en BF16 ou FP16 même lorsque les blocs transformer sont quantifiés, ce qui laisse un écart de stockage dans les déploiements pratiques. ARCHead pourrait réduire la taille des LLM quantifiés en poids uniquement en s’attaquant à cette dernière couche de projection.

Points clés

  • 1.Compresse le stockage des têtes LM d’un facteur 3,7 à 3,9.
  • 2.N’utilise que 25,6 % du stockage d’une tête BF16 sur Qwen3-8B-Base.
  • 3.Ajoute une variation du débit inférieure à 2 % dans les tests rapportés.

Des chercheurs ont présenté ARCHead, un compresseur compact pour les têtes de sortie des grands modèles de langage, qui combine un noyau bas rang quantifié, des résidus INT4 par groupes et une correction bas rang ajustée selon une métrique dérivée des activations. Selon l’article, ARCHead réduit le stockage persistant des têtes LM d’un facteur 3,7 à 3,9 et, sur Qwen3-8B-Base, n’utilise que 25,6 % du stockage d’une tête BF16 tout en atteignant une perplexité relative de 1,007. Le remplacement de la tête BF16 laissée par AWQ ou bitsandbytes a ajouté 0,006 à 0,007 d’entropie croisée, avec une variation du débit inférieure à 2 % dans les mesures des auteurs.

À tester aujourd'hui

Si vous déployez des modèles quantifiés avec AWQ ou bitsandbytes, examinez le code d’ARCHead et testez la compression des têtes de sortie sur votre modèle cible avant de continuer à vous appuyer sur des têtes BF16.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche