AAI News Hub
研究Fri, August 21, 2026·3h ago2 sources corroborating

SWE-bench Science、科学コードでコーディングエージェントを検証

このベンチマークは、20の科学分野にまたがる98のGitHubリポジトリから119件のタスクを収録している。

なぜ重要か

科学ソフトウェアは研究結論の根拠となるエビデンスに直接影響し得るため、修正の品質は通常のコードベンチマークで捉えられる以上に重要になる。今回の結果は、現在のコーディングエージェントが、分野特化型リポジトリにおける科学的知識、探索、統合、汎化の面でなお苦戦していることを示している。

要点

  • 1.119件のタスクは、98のリポジトリと20の科学分野にまたがる。
  • 2.Claude Code with Opus-5 (max)のpass@1は50%未満だった。
  • 3.失敗例には、分野知識、探索、統合、汎化に関するギャップが含まれる。

研究者らは、科学ソフトウェアエンジニアリングのタスクでコーディングエージェントを評価するリポジトリレベルのベンチマーク、SWE-bench Scienceを発表した。このベンチマークは、20の科学分野にまたがる98のGitHubリポジトリから119件のタスクで構成され、Issue主導、専門家による探索、エンジニアリング統合の3つのパラダイムに整理されている。報告書によると、最も高い性能を示したエージェントであるClaude Code with Opus-5 (max)でも、pass@1は50%未満だった。

今日から使える

科学ソフトウェアの修正をコーディングエージェントに任せる前に、SWE-bench Scienceをストレステストとして活用すべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究