Nuevos papers apuntan a la atención dispersa para la IA de contexto largo
Investigadores proponen métodos para abaratar la inferencia de contexto largo, el serving, la generación de video y la memoria.
Por qué importa
Los sistemas de IA de contexto largo están cada vez más limitados por el cómputo de la atención y la memoria de la KV-cache. Estos papers apuntan a un cambio más amplio: pasar de simplemente ampliar las ventanas de contexto a hacer que la inferencia de contexto largo sea práctica bajo límites reales de hardware y serving.
Puntos clave
- 1.La atención dispersa sigue siendo una vía central para abaratar la inferencia de contexto largo.
- 2.FlashPrefill V2 apunta a funciones de serving en producción, como paged KV cache y batching.
- 3.MoNe reporta menor cómputo y memoria en contextos de 128K tokens.
Varios nuevos papers en arXiv proponen formas de reducir el costo de la atención de contexto largo en sistemas transformer. Los trabajos incluyen el ajuste fino de modelos para que se coadapten con políticas de atención dispersa en la KV-cache, FlashPrefill V2 para atención de prefill block-sparse en el serving de LLM, SparsePR para atención dispersa sin entrenamiento en generación de video y modelos del mundo, y MoNe, una memoria neuronal modular para Transformers congelados. Los papers reportan mejoras como menor error de reconstrucción, soporte para funciones de serving orientadas a producción y menor cómputo y memoria en contextos de 128K tokens.
⚡ Pruébalo hoy
Si sirves o ajustas modelos de contexto largo, evalúa las políticas de atención dispersa y KV-cache frente a tus propios objetivos de latencia, memoria y calidad antes de escalar la longitud de contexto.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.CLLearning how to Forget: Fine-tuning for Long-Context Sparse AttentionAug 21, 12:00 PM↗
- arXiv cs.CLFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 21, 12:00 PM↗
- HF Daily PapersFlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM ServingAug 20, 12:02 PM↗
- arXiv cs.LGPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.AIPartition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World ModelsAug 20, 12:00 PM↗
- arXiv cs.LGMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.AIMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
- arXiv cs.CLMoNe: Modular Neural Memory for Efficient Long Context InferenceAug 19, 12:00 PM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
MemTrapBench pone a prueba las trampas cognitivas en el uso de memoria por los LLM
El benchmark concluye que la memoria puede degradar el rendimiento en tareas incluso cuando los registros recuperados son relevantes.
AI4AI-Bench pone a prueba a los agentes en el diseño de algoritmos de entrenamiento
El benchmark publicado en arXiv evalúa si los agentes basados en LLM pueden reescribir algoritmos de entrenamiento en repositorios congelados.
SWE-bench Science pone a prueba a los agentes de programación con código científico
El benchmark incluye 119 tareas de 98 repositorios de GitHub en 20 dominios científicos.