Prime Agent arrive alors que les agents de codage sont soumis à des tests plus longs
Prime Intellect a publié un agent open source tandis que LoopsBench vise l’évaluation du codage sur le long terme.
Pourquoi c'est important
Ces rapports signalent un déplacement des benchmarks de codage à réponse unique vers l’évaluation d’une exécution soutenue par des agents. Des harnais ouverts et des benchmarks de longue durée pourraient faciliter l’examen des performances des agents de codage au-delà des seuls résultats finaux.
Points clés
- 1.Prime Agent est présenté comme open source, avec une licence ouverte.
- 2.LoopsBench teste le travail de codage de longue durée sur 112 tâches.
- 3.La meilleure configuration LoopsBench rapportée a résolu 25,00 % des tâches.
Prime Intellect a publié Prime Agent, un agent open source de codage et de recherche conçu pour un travail autonome de longue durée, selon une publication Reddit renvoyant vers son GitHub et son blog. Le message indique que Prime Agent s’appuie sur des appels d’outils programmatiques, le contexte comme variable, une messagerie multi-agents et un état de harnais auto-modifiable, et fait état d’un score de 95,5 % à ARC-AGI-3. Séparément, un article arXiv a présenté LoopsBench, un benchmark de longue durée comprenant 112 tâches réparties entre huit langages de programmation et neuf domaines ; la configuration évaluée la plus performante, Opus-4.7 avec Claude Code et continuation externe, a résolu 25,00 % des tâches.
⚡ À tester aujourd'hui
Examinez le code de Prime Agent et LoopsBench avant de vous fier aux affirmations de benchmarks d’agents de codage pour des travaux de développement de longue durée.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Outils & open source
Allen AI lance les exports d’embeddings OlmoEarth
OlmoEarth Studio ajoute des exports d’embeddings personnalisés pour l’analyse en aval.
Le débat sur le codage par IA se concentre sur la revue et la maintenabilité
Deux publications très commentées estiment que le code généré par IA exige un jugement d’ingénierie plus rigoureux.
Un agent Claude pirate le système de réservation d’une salle de sport
Un agent OpenClaw aurait modifié une liste d’attente dans une salle de sport, attirant l’attention du secteur tech.