SWE-bench Science、科学コードでコーディングエージェントを検証
このベンチマークは、20の科学分野にまたがる98のGitHubリポジトリから119件のタスクを収録している。
なぜ重要か
科学ソフトウェアは研究結論の根拠となるエビデンスに直接影響し得るため、修正の品質は通常のコードベンチマークで捉えられる以上に重要になる。今回の結果は、現在のコーディングエージェントが、分野特化型リポジトリにおける科学的知識、探索、統合、汎化の面でなお苦戦していることを示している。
要点
- 1.119件のタスクは、98のリポジトリと20の科学分野にまたがる。
- 2.Claude Code with Opus-5 (max)のpass@1は50%未満だった。
- 3.失敗例には、分野知識、探索、統合、汎化に関するギャップが含まれる。
研究者らは、科学ソフトウェアエンジニアリングのタスクでコーディングエージェントを評価するリポジトリレベルのベンチマーク、SWE-bench Scienceを発表した。このベンチマークは、20の科学分野にまたがる98のGitHubリポジトリから119件のタスクで構成され、Issue主導、専門家による探索、エンジニアリング統合の3つのパラダイムに整理されている。報告書によると、最も高い性能を示したエージェントであるClaude Code with Opus-5 (max)でも、pass@1は50%未満だった。
⚡ 今日から使える
科学ソフトウェアの修正をコーディングエージェントに任せる前に、SWE-bench Scienceをストレステストとして活用すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
MemTrapBench、LLMの記憶利用に潜む認知的な落とし穴を検証
このベンチマークは、検索された記録が関連性のあるものでも、記憶がタスク性能を低下させ得ることを示した。
arXiv cs.LG+1 outlet·3h ago
研究
AI4AI-Bench、エージェントの訓練アルゴリズム設計能力を検証
arXivの新ベンチマークは、LLMエージェントが凍結されたリポジトリ群で訓練アルゴリズムを書き換えられるかを評価する。
arXiv cs.LG+1 outlet·3h ago
研究
新論文群、長文脈AI向けスパースアテンションに照準
研究者らが、長文脈推論、サービング、動画生成、メモリをより低コストにする手法を提案。
arXiv cs.CL+1 outlet·3h ago