De nouveaux articles ciblent l’attention éparse pour l’IA à long contexte
Des chercheurs proposent des méthodes pour rendre moins coûteuses l’inférence à long contexte, le serving, la génération vidéo et la mémoire.
Pourquoi c'est important
Les systèmes d’IA à long contexte sont de plus en plus limités par le coût de calcul de l’attention et la mémoire du KV-cache. Ces articles indiquent un basculement plus large : il ne s’agit plus seulement d’étendre les fenêtres de contexte, mais de rendre l’inférence à long contexte praticable dans les limites réelles du matériel et du serving.
Points clés
- 1.L’attention éparse reste une voie centrale pour réduire le coût de l’inférence à long contexte.
- 2.FlashPrefill V2 vise des fonctionnalités de serving en production, notamment le KV cache paginé et le batching.
- 3.MoNe fait état d’une baisse du calcul et de la mémoire pour des contextes de 128K tokens.
Plusieurs nouveaux articles publiés sur arXiv proposent des moyens de réduire le coût de l’attention à long contexte dans les systèmes Transformer. Ces travaux portent notamment sur l’affinage de modèles afin qu’ils se coadaptent avec des politiques d’attention éparse pour le KV-cache, FlashPrefill V2 pour l’attention de préremplissage block-sparse dans le serving de LLM, SparsePR pour une attention éparse sans entraînement dans la génération vidéo et les modèles du monde, ainsi que MoNe, une mémoire neuronale modulaire pour des Transformers gelés. Les articles font état d’améliorations telles qu’une erreur de reconstruction plus faible, la prise en charge de fonctionnalités de serving orientées production, ainsi qu’une réduction du calcul et de la mémoire pour des contextes de 128K tokens.
⚡ À tester aujourd'hui
Si vous servez ou affinez des modèles à long contexte, évaluez les politiques d’attention éparse et de KV-cache au regard de vos propres objectifs de latence, de mémoire et de qualité avant d’augmenter la longueur de contexte.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.CLLearning how to Forget: Fine-tuning for Long-Context Sparse AttentionAug 21, 12:00 PM↗
- arXiv cs.CLFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 21, 12:00 PM↗
- HF Daily PapersFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 20, 12:02 PM↗
- arXiv cs.LGPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.AIPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.LGMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.AIMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.CLMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.
SWE-bench Science met les agents de code à l’épreuve sur du code scientifique
Le benchmark comprend 119 tâches issues de 98 dépôts GitHub, couvrant 20 domaines scientifiques.