ARCHead apunta a comprimir la capa de salida de los LLM
El método comprime el almacenamiento de la LM-head sin conservar una capa densa en BF16, según un nuevo artículo en arXiv.
Por qué importa
Las capas de salida suelen mantenerse en BF16 o FP16 incluso cuando los bloques transformer están cuantizados, lo que deja una brecha de almacenamiento en despliegues prácticos. ARCHead podría reducir el tamaño de los LLM cuantizados solo por pesos al abordar esa capa de proyección restante.
Puntos clave
- 1.Comprime el almacenamiento de la LM-head entre 3,7 y 3,9 veces.
- 2.Usa el 25,6% del almacenamiento de una capa BF16 en Qwen3-8B-Base.
- 3.Añade un cambio de rendimiento inferior al 2% en las pruebas reportadas.
Investigadores presentaron ARCHead, un compresor empaquetado para las capas de salida de grandes modelos de lenguaje que combina un núcleo cuantizado de bajo rango, residuales INT4 por grupos y una corrección de bajo rango ajustada con una métrica derivada de activaciones. El artículo afirma que ARCHead reduce el almacenamiento persistente de la LM-head entre 3,7 y 3,9 veces y que, en Qwen3-8B-Base, usa el 25,6% del almacenamiento de una capa en BF16, con una perplejidad relativa de 1,007. Sustituir la capa BF16 que dejan AWQ o bitsandbytes añadió entre 0,006 y 0,007 de entropía cruzada, con un cambio de rendimiento inferior al 2% en las mediciones de los autores.
⚡ Pruébalo hoy
Si despliegas modelos cuantizados con AWQ o bitsandbytes, revisa el código de ARCHead y prueba la compresión de la capa de salida en tu modelo objetivo antes de depender de capas BF16.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- arXiv cs.LGARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 5, 12:00 PM↗
- HF Daily PapersARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsAug 3, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.