AAI News Hub
HerramientasThu, August 6, 2026·6d ago3 sources corroborating

Prime Agent se lanza mientras los agentes de programación afrontan pruebas más largas

Prime Intellect publicó un agente de código abierto, mientras LoopsBench apunta a la evaluación de programación de largo horizonte.

Por qué importa

Los informes apuntan a un desplazamiento desde los benchmarks de programación de intento único hacia la evaluación de la ejecución sostenida de agentes. Los arneses abiertos y los benchmarks de largo horizonte podrían facilitar la inspección del rendimiento de los agentes de programación más allá de los resultados finales.

Puntos clave

  • 1.Prime Agent se describe como de código abierto y con una licencia abierta.
  • 2.LoopsBench evalúa trabajo de programación de largo horizonte en 112 tareas.
  • 3.La mejor configuración reportada en LoopsBench resolvió el 25,00% de las tareas.

Prime Intellect lanzó Prime Agent, un agente de programación e investigación de código abierto para trabajo autónomo de larga duración, según una publicación en Reddit que enlaza a su GitHub y su blog. La publicación afirma que Prime Agent usa llamadas programáticas a herramientas, contexto como variable, mensajería multiagente y un estado de arnés automodificable, y reporta una puntuación de 95,5% en ARC-AGI-3. Por separado, un artículo en arXiv presentó LoopsBench, un benchmark de largo horizonte con 112 tareas en ocho lenguajes de programación y nueve dominios; su configuración evaluada más sólida, Opus-4.7 con Claude Code y continuación externa, resolvió el 25,00% de las tareas.

Pruébalo hoy

Revise el código de Prime Agent y LoopsBench antes de confiar en afirmaciones de benchmarks de agentes de programación para trabajos de desarrollo de larga duración.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Herramientas y OSS