Pesquisadores identificam modo de falha na atenção ALiBi
O artigo afirma que underflow de ponto flutuante pode deixar algumas cabeças de atenção ALiBi parcialmente cegas.
Por que importa
A descoberta sugere que resultados em benchmarks comuns podem deixar passar fragilidades de recuperação causadas por aspectos numéricos da codificação posicional. Ela dá aos desenvolvedores de modelos um modo de falha concreto para testar ao treinar ou avaliar sistemas de contexto longo baseados em ALiBi.
Pontos-chave
- 1.Underflow de ponto flutuante pode zerar pesos de atenção ALiBi.
- 2.A recuperação de tokens sofre mais do que os benchmarks padrão de decodificadores.
- 3.Distâncias em escala logarítmica trouxeram os ganhos mais consistentes em passkeys.
Um novo artigo no arXiv identifica um modo de falha numérica nas codificações posicionais ALiBi, em que a escala linear do viés pode sofrer underflow na precisão de ponto flutuante e zerar muitos pesos de atenção. Os autores relatam que o problema aparece em modelos pré-treinados de ponta baseados em ALiBi e pode prejudicar substancialmente a recuperação de tokens, embora tenha apenas um efeito pequeno em benchmarks padrão de decodificadores. Em experimentos de pré-treinamento com decodificadores de 148 milhões de parâmetros, eles avaliaram quatro mitigações durante o treinamento e descobriram que distâncias em escala logarítmica melhoraram de forma mais consistente a recuperação de passkeys.
⚡ Experimente hoje
Se você treina ou avalia modelos ALiBi, inclua testes de recuperação de tokens e de passkeys e compare a mitigação por distâncias em escala logarítmica com as inclinações padrão.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.