SWE-bench Science met les agents de code à l’épreuve sur du code scientifique
Le benchmark comprend 119 tâches issues de 98 dépôts GitHub, couvrant 20 domaines scientifiques.
Pourquoi c'est important
Les logiciels scientifiques peuvent influer directement sur les éléments de preuve qui sous-tendent les conclusions de recherche, ce qui rend la qualité des corrections plus déterminante que ne le mesurent les benchmarks de code ordinaires. Les résultats suggèrent que les agents de code actuels peinent encore avec les connaissances scientifiques, l’exploration, l’intégration et la généralisation dans des dépôts propres à un domaine.
Points clés
- 1.119 tâches couvrent 98 dépôts et 20 domaines scientifiques.
- 2.Claude Code avec Opus-5 (max) a obtenu un pass@1 inférieur à 50 %.
- 3.Les échecs incluent des lacunes en connaissances de domaine, exploration, intégration et généralisation.
Des chercheurs ont présenté SWE-bench Science, un benchmark au niveau des dépôts destiné à évaluer les agents de code sur des tâches d’ingénierie logicielle scientifique. Il réunit 119 tâches provenant de 98 dépôts GitHub dans 20 domaines scientifiques, organisées selon trois paradigmes : piloté par les issues, exploration par des experts et intégration d’ingénierie. Selon le rapport, l’agent le plus performant, Claude Code avec Opus-5 (max), a obtenu un pass@1 inférieur à 50 %.
⚡ À tester aujourd'hui
Utilisez SWE-bench Science comme test de résistance avant de vous appuyer sur des agents de code pour corriger des logiciels scientifiques.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.
De nouveaux articles ciblent l’attention éparse pour l’IA à long contexte
Des chercheurs proposent des méthodes pour rendre moins coûteuses l’inférence à long contexte, le serving, la génération vidéo et la mémoire.