AAI News Hub
ForschungFri, August 21, 2026·3h ago2 sources corroborating

SWE-bench Science testet Coding-Agenten an wissenschaftlichem Code

Der Benchmark umfasst 119 Aufgaben aus 98 GitHub-Repositories in 20 wissenschaftlichen Fachgebieten.

Warum es wichtig ist

Wissenschaftliche Software kann die Evidenz hinter Forschungsergebnissen direkt beeinflussen. Deshalb hat die Qualität von Reparaturen größere Tragweite, als gewöhnliche Code-Benchmarks abbilden. Die Ergebnisse deuten darauf hin, dass aktuelle Coding-Agenten weiterhin Schwierigkeiten mit wissenschaftlichem Fachwissen, Exploration, Integration und Generalisierung in domänenspezifischen Repositories haben.

Die Kernpunkte

  • 1.119 Aufgaben erstrecken sich über 98 Repositories und 20 wissenschaftliche Fachgebiete.
  • 2.Claude Code mit Opus-5 (max) erzielte einen pass@1-Wert von unter 50 %.
  • 3.Zu den Fehlerquellen zählen Lücken bei Fachwissen, Exploration, Integration und Generalisierung.

Forscher haben SWE-bench Science vorgestellt, einen Benchmark auf Repository-Ebene zur Bewertung von Coding-Agenten bei Aufgaben des wissenschaftlichen Software Engineerings. Der Benchmark umfasst 119 Aufgaben aus 98 GitHub-Repositories in 20 wissenschaftlichen Fachgebieten und ist in die Paradigmen Issue-driven, Expert-exploratory und Engineering-integration gegliedert. Dem Bericht zufolge erreichte der leistungsstärkste Agent, Claude Code mit Opus-5 (max), einen pass@1-Wert von unter 50 %.

Heute ausprobieren

Nutzen Sie SWE-bench Science als Stresstest, bevor Sie Coding-Agenten für die Reparatur wissenschaftlicher Software einsetzen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung