AAI News Hub
PesquisaWed, August 5, 2026·Aug 52 sources corroborating

Pesquisadores identificam modo de falha na atenção ALiBi

O artigo afirma que underflow de ponto flutuante pode deixar algumas cabeças de atenção ALiBi parcialmente cegas.

Por que importa

A descoberta sugere que resultados em benchmarks comuns podem deixar passar fragilidades de recuperação causadas por aspectos numéricos da codificação posicional. Ela dá aos desenvolvedores de modelos um modo de falha concreto para testar ao treinar ou avaliar sistemas de contexto longo baseados em ALiBi.

Pontos-chave

  • 1.Underflow de ponto flutuante pode zerar pesos de atenção ALiBi.
  • 2.A recuperação de tokens sofre mais do que os benchmarks padrão de decodificadores.
  • 3.Distâncias em escala logarítmica trouxeram os ganhos mais consistentes em passkeys.

Um novo artigo no arXiv identifica um modo de falha numérica nas codificações posicionais ALiBi, em que a escala linear do viés pode sofrer underflow na precisão de ponto flutuante e zerar muitos pesos de atenção. Os autores relatam que o problema aparece em modelos pré-treinados de ponta baseados em ALiBi e pode prejudicar substancialmente a recuperação de tokens, embora tenha apenas um efeito pequeno em benchmarks padrão de decodificadores. Em experimentos de pré-treinamento com decodificadores de 148 milhões de parâmetros, eles avaliaram quatro mitigações durante o treinamento e descobriram que distâncias em escala logarítmica melhoraram de forma mais consistente a recuperação de passkeys.

Experimente hoje

Se você treina ou avalia modelos ALiBi, inclua testes de recuperação de tokens e de passkeys e compare a mitigação por distâncias em escala logarítmica com as inclinações padrão.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa