Investigadores identifican un modo de fallo en la atención ALiBi
El artículo sostiene que el subdesbordamiento de coma flotante puede dejar parcialmente ciegas algunas cabezas de atención ALiBi.
Por qué importa
El hallazgo sugiere que los resultados en benchmarks habituales pueden pasar por alto debilidades de recuperación causadas por la aritmética de las codificaciones posicionales. Ofrece a los desarrolladores de modelos un modo de fallo concreto que probar al entrenar o evaluar sistemas de contexto largo basados en ALiBi.
Puntos clave
- 1.El subdesbordamiento de coma flotante puede llevar a cero los pesos de atención ALiBi.
- 2.La recuperación de tokens se ve más afectada que los benchmarks estándar de decodificadores.
- 3.Las distancias con escalado logarítmico ofrecieron las mejoras más consistentes en la recuperación de claves de acceso.
Un nuevo artículo en arXiv identifica un fallo numérico en las codificaciones posicionales ALiBi, en el que el escalado lineal del sesgo puede sufrir subdesbordamiento en la precisión de coma flotante y llevar a cero muchos pesos de atención. Los autores señalan que el problema aparece en modelos preentrenados de última generación basados en ALiBi y puede perjudicar de forma sustancial la recuperación de tokens, aunque tiene solo un efecto menor en benchmarks estándar de decodificadores. En experimentos de preentrenamiento con decodificadores de 148 millones de parámetros, evaluaron cuatro mitigaciones aplicadas durante el entrenamiento y encontraron que las distancias con escalado logarítmico fueron las que mejoraron de forma más consistente la recuperación de claves de acceso.
⚡ Pruébalo hoy
Si entrenas o evalúas modelos ALiBi, añade pruebas de recuperación de tokens y de claves de acceso, y compara la mitigación con distancias de escalado logarítmico frente a las pendientes por defecto.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.