AAI News Hub
PesquisaWed, August 5, 2026·Aug 52 sources corroborating

ARCHead mira compressão do output head de LLMs

O método comprime o armazenamento do LM-head sem manter uma cabeça densa em BF16, segundo um novo artigo no arXiv.

Por que importa

Output heads muitas vezes permanecem em BF16 ou FP16 mesmo quando os blocos transformer são quantizados, deixando uma lacuna de armazenamento em implantações práticas. O ARCHead pode tornar LLMs quantizados apenas por pesos menores ao atacar essa camada de projeção remanescente.

Pontos-chave

  • 1.Comprime o armazenamento do LM-head em 3,7-3,9x.
  • 2.Usa 25,6% do armazenamento de uma cabeça BF16 no Qwen3-8B-Base.
  • 3.Acrescenta variação de throughput inferior a 2% nos testes reportados.

Pesquisadores apresentaram o ARCHead, um compressor empacotado para output heads de grandes modelos de linguagem que combina um núcleo quantizado de baixa dimensão, resíduos INT4 por grupo e uma correção de baixa dimensão ajustada em uma métrica derivada de ativações. O artigo afirma que o ARCHead reduz o armazenamento persistente do LM-head em 3,7-3,9x e, no Qwen3-8B-Base, usa 25,6% do armazenamento de uma cabeça BF16, atingindo perplexidade relativa de 1,007. Substituir a cabeça BF16 deixada por AWQ ou bitsandbytes acrescentou 0,006-0,007 de entropia cruzada, com variação de throughput inferior a 2% nas medições dos autores.

Experimente hoje

Se você implanta modelos quantizados com AWQ ou bitsandbytes, revise o código do ARCHead e teste a compressão do output head no seu modelo-alvo antes de depender de cabeças BF16.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa