AAI News Hub
RechercheFri, August 21, 2026·3h ago2 sources corroborating

SWE-bench Science met les agents de code à l’épreuve sur du code scientifique

Le benchmark comprend 119 tâches issues de 98 dépôts GitHub, couvrant 20 domaines scientifiques.

Pourquoi c'est important

Les logiciels scientifiques peuvent influer directement sur les éléments de preuve qui sous-tendent les conclusions de recherche, ce qui rend la qualité des corrections plus déterminante que ne le mesurent les benchmarks de code ordinaires. Les résultats suggèrent que les agents de code actuels peinent encore avec les connaissances scientifiques, l’exploration, l’intégration et la généralisation dans des dépôts propres à un domaine.

Points clés

  • 1.119 tâches couvrent 98 dépôts et 20 domaines scientifiques.
  • 2.Claude Code avec Opus-5 (max) a obtenu un pass@1 inférieur à 50 %.
  • 3.Les échecs incluent des lacunes en connaissances de domaine, exploration, intégration et généralisation.

Des chercheurs ont présenté SWE-bench Science, un benchmark au niveau des dépôts destiné à évaluer les agents de code sur des tâches d’ingénierie logicielle scientifique. Il réunit 119 tâches provenant de 98 dépôts GitHub dans 20 domaines scientifiques, organisées selon trois paradigmes : piloté par les issues, exploration par des experts et intégration d’ingénierie. Selon le rapport, l’agent le plus performant, Claude Code avec Opus-5 (max), a obtenu un pass@1 inférieur à 50 %.

À tester aujourd'hui

Utilisez SWE-bench Science comme test de résistance avant de vous appuyer sur des agents de code pour corriger des logiciels scientifiques.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche