SWE-bench Science testet Coding-Agenten an wissenschaftlichem Code
Der Benchmark umfasst 119 Aufgaben aus 98 GitHub-Repositories in 20 wissenschaftlichen Fachgebieten.
Warum es wichtig ist
Wissenschaftliche Software kann die Evidenz hinter Forschungsergebnissen direkt beeinflussen. Deshalb hat die Qualität von Reparaturen größere Tragweite, als gewöhnliche Code-Benchmarks abbilden. Die Ergebnisse deuten darauf hin, dass aktuelle Coding-Agenten weiterhin Schwierigkeiten mit wissenschaftlichem Fachwissen, Exploration, Integration und Generalisierung in domänenspezifischen Repositories haben.
Die Kernpunkte
- 1.119 Aufgaben erstrecken sich über 98 Repositories und 20 wissenschaftliche Fachgebiete.
- 2.Claude Code mit Opus-5 (max) erzielte einen pass@1-Wert von unter 50 %.
- 3.Zu den Fehlerquellen zählen Lücken bei Fachwissen, Exploration, Integration und Generalisierung.
Forscher haben SWE-bench Science vorgestellt, einen Benchmark auf Repository-Ebene zur Bewertung von Coding-Agenten bei Aufgaben des wissenschaftlichen Software Engineerings. Der Benchmark umfasst 119 Aufgaben aus 98 GitHub-Repositories in 20 wissenschaftlichen Fachgebieten und ist in die Paradigmen Issue-driven, Expert-exploratory und Engineering-integration gegliedert. Dem Bericht zufolge erreichte der leistungsstärkste Agent, Claude Code mit Opus-5 (max), einen pass@1-Wert von unter 50 %.
⚡ Heute ausprobieren
Nutzen Sie SWE-bench Science als Stresstest, bevor Sie Coding-Agenten für die Reparatur wissenschaftlicher Software einsetzen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MemTrapBench testet kognitive Fallen beim Speichereinsatz von LLMs
Der Benchmark zeigt, dass Speicher die Aufgabenleistung verschlechtern kann, selbst wenn die abgerufenen Einträge relevant sind.
AI4AI-Bench testet Agenten beim Entwurf von Trainingsalgorithmen
Der arXiv-Benchmark prüft, ob LLM-Agenten Trainingsalgorithmen in eingefrorenen Repositories umschreiben können.
Neue Arbeiten zielen auf Sparse Attention für Long-Context-KI
Forschende schlagen Methoden für günstigere Long-Context-Inferenz, Serving, Videogenerierung und Speicher vor.