Novos artigos miram atenção esparsa para IA de contexto longo
Pesquisadores propõem métodos para inferência, serving, geração de vídeo e memória em contexto longo com menor custo.
Por que importa
Sistemas de IA de contexto longo estão cada vez mais limitados pelo custo computacional da atenção e pela memória do KV-cache. Esses artigos apontam para uma mudança mais ampla: em vez de apenas ampliar janelas de contexto, tornar a inferência em contexto longo viável dentro dos limites reais de hardware e serving.
Pontos-chave
- 1.A atenção esparsa segue como um caminho central para baratear a inferência em contexto longo.
- 2.O FlashPrefill V2 mira recursos de serving em produção, incluindo KV cache paginado e batching.
- 3.O MoNe relata menor uso de computação e memória em contextos de 128 mil tokens.
Vários novos artigos no arXiv propõem formas de reduzir o custo da atenção em contexto longo em sistemas Transformer. Os trabalhos incluem o ajuste fino de modelos para coadaptação com políticas de atenção esparsa em KV-cache, o FlashPrefill V2 para atenção de prefill esparsa por blocos no serving de LLMs, o SparsePR para atenção esparsa sem treinamento em geração de vídeo e world models, e o MoNe, uma memória neural modular para Transformers congelados. Os artigos relatam avanços como menor erro de reconstrução, suporte a recursos de serving voltados à produção e redução de computação e memória em contextos de 128 mil tokens.
⚡ Experimente hoje
Se você faz serving ou ajuste fino de modelos de contexto longo, avalie políticas de atenção esparsa e KV-cache de acordo com suas próprias metas de latência, memória e qualidade antes de escalar o tamanho do contexto.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLLearning how to Forget: Fine-tuning for Long-Context Sparse AttentionAug 21, 12:00 PM↗
- arXiv cs.CLFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 21, 12:00 PM↗
- HF Daily PapersFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 20, 12:02 PM↗
- arXiv cs.LGPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.AIPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.LGMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.AIMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.CLMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
MemTrapBench testa armadilhas cognitivas no uso de memória por LLMs
O benchmark mostra que a memória pode prejudicar o desempenho em tarefas mesmo quando os registros recuperados são relevantes.
AI4AI-Bench testa agentes no design de algoritmos de treinamento
O benchmark no arXiv avalia se agentes de LLM conseguem reescrever algoritmos de treinamento em repositórios congelados.
SWE-bench Science testa agentes de programação em código científico
O benchmark inclui 119 tarefas de 98 repositórios do GitHub em 20 domínios científicos.