AAI News Hub
OutilsThu, August 6, 2026·6d ago3 sources corroborating

Prime Agent arrive alors que les agents de codage sont soumis à des tests plus longs

Prime Intellect a publié un agent open source tandis que LoopsBench vise l’évaluation du codage sur le long terme.

Pourquoi c'est important

Ces rapports signalent un déplacement des benchmarks de codage à réponse unique vers l’évaluation d’une exécution soutenue par des agents. Des harnais ouverts et des benchmarks de longue durée pourraient faciliter l’examen des performances des agents de codage au-delà des seuls résultats finaux.

Points clés

  • 1.Prime Agent est présenté comme open source, avec une licence ouverte.
  • 2.LoopsBench teste le travail de codage de longue durée sur 112 tâches.
  • 3.La meilleure configuration LoopsBench rapportée a résolu 25,00 % des tâches.

Prime Intellect a publié Prime Agent, un agent open source de codage et de recherche conçu pour un travail autonome de longue durée, selon une publication Reddit renvoyant vers son GitHub et son blog. Le message indique que Prime Agent s’appuie sur des appels d’outils programmatiques, le contexte comme variable, une messagerie multi-agents et un état de harnais auto-modifiable, et fait état d’un score de 95,5 % à ARC-AGI-3. Séparément, un article arXiv a présenté LoopsBench, un benchmark de longue durée comprenant 112 tâches réparties entre huit langages de programmation et neuf domaines ; la configuration évaluée la plus performante, Opus-4.7 avec Claude Code et continuation externe, a résolu 25,00 % des tâches.

À tester aujourd'hui

Examinez le code de Prime Agent et LoopsBench avant de vous fier aux affirmations de benchmarks d’agents de codage pour des travaux de développement de longue durée.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Outils & open source