Un estudio analiza las rutas de control en GPU para agentes LLM
Ready Cohorts modela cuándo el trabajo de control de agentes puede permanecer en la GPU en lugar de volver al host.
Por qué importa
El trabajo apunta a un cuello de botella creciente en los sistemas de servicios de agentes: las frecuentes transiciones de control entre llamadas al modelo y a herramientas. Sugiere que el enrutamiento residente en GPU puede reducir los viajes de ida y vuelta al host, pero los resultados basados en trazas están acotados por los supuestos del artículo y no constituyen prueba de identidad ejecutable.
Puntos clave
- 1.Ready Cohorts delimita la oportunidad de uso de GPU en las rutas de control de agentes LLM.
- 2.La reproducción principal de trazas reporta P*=43.00% bajo las condiciones indicadas.
- 3.El enrutamiento residente en el dispositivo fue más rápido en las 36 configuraciones estudiadas.
Un nuevo artículo en arXiv, también incluido en HF Daily Papers, examina si pequeñas transiciones de control deterministas en servicios de agentes LLM generan suficiente trabajo concurrente para ejecutarse en GPU. Con una reproducción estacionaria de Poisson de un panel público fijado de 851 sesiones, los autores reportan F=30.19%, P*=43.00% y U=45.85% bajo la condición principal de 100,000 sesiones activas objetivo, K=256 y un plazo de lanzamiento de 50 ms. También estudian mantener en el dispositivo una decisión binaria de enrutamiento calculada en GPU, en vez de devolver cuatro bytes al host y redistribuir la tarea, y hallan que la ruta residente en el dispositivo fue más rápida en las 36 configuraciones descritas en las fuentes.
⚡ Pruébalo hoy
Lea el artículo antes de trasladar la orquestación de agentes a la GPU y compare sus propias trazas de enrutamiento con los supuestos de Ready Cohorts.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Un estudio concluye que el contexto de auditoría y reparación vuelve más permisivos a los verificadores basados en LLM
El artículo de arXiv reporta menos falsas alarmas tras episodios previos de auditoría y reparación en el contexto del modelo.
AlphaEvolve ayuda a reducir la cota de la multiplicación de matrices
Una nueva nota en arXiv informa de una mejora en la cota superior del exponente de la multiplicación de matrices.
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.