ARCHead mira compressão do output head de LLMs
O método comprime o armazenamento do LM-head sem manter uma cabeça densa em BF16, segundo um novo artigo no arXiv.
Por que importa
Output heads muitas vezes permanecem em BF16 ou FP16 mesmo quando os blocos transformer são quantizados, deixando uma lacuna de armazenamento em implantações práticas. O ARCHead pode tornar LLMs quantizados apenas por pesos menores ao atacar essa camada de projeção remanescente.
Pontos-chave
- 1.Comprime o armazenamento do LM-head em 3,7-3,9x.
- 2.Usa 25,6% do armazenamento de uma cabeça BF16 no Qwen3-8B-Base.
- 3.Acrescenta variação de throughput inferior a 2% nos testes reportados.
Pesquisadores apresentaram o ARCHead, um compressor empacotado para output heads de grandes modelos de linguagem que combina um núcleo quantizado de baixa dimensão, resíduos INT4 por grupo e uma correção de baixa dimensão ajustada em uma métrica derivada de ativações. O artigo afirma que o ARCHead reduz o armazenamento persistente do LM-head em 3,7-3,9x e, no Qwen3-8B-Base, usa 25,6% do armazenamento de uma cabeça BF16, atingindo perplexidade relativa de 1,007. Substituir a cabeça BF16 deixada por AWQ ou bitsandbytes acrescentou 0,006-0,007 de entropia cruzada, com variação de throughput inferior a 2% nas medições dos autores.
⚡ Experimente hoje
Se você implanta modelos quantizados com AWQ ou bitsandbytes, revise o código do ARCHead e teste a compressão do output head no seu modelo-alvo antes de depender de cabeças BF16.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- arXiv cs.LGARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- HF Daily PapersARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 3, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Pesquisadores propõem Power Law Graph Attention
PLGA generaliza a atenção por produto escalar escalonado e relata colapso de inferência sob invariância exata.