SWE-bench Science 测试编码代理处理科学代码的能力
该基准包含来自 98 个 GitHub 仓库、覆盖 20 个科学领域的 119 项任务。
为什么重要
科学软件可能直接影响研究结论背后的证据,因此修复质量的重要性超出了普通代码基准所能体现的范围。结果表明,当前编码代理在特定领域仓库中仍难以应对科学知识、探索、集成和泛化等方面的挑战。
核心要点
- 1.119 项任务覆盖 98 个仓库和 20 个科学领域。
- 2.Claude Code with Opus-5 (max) 的 pass@1 得分低于 50%。
- 3.失败原因包括领域知识、探索、集成和泛化方面的不足。
研究人员推出了 SWE-bench Science,这是一个仓库级基准,用于评估编码代理在科学软件工程任务中的表现。该基准包含来自 98 个 GitHub 仓库、覆盖 20 个科学领域的 119 项任务,并按 Issue 驱动、专家探索和工程集成三类范式组织。报告称,表现最佳的代理 Claude Code with Opus-5 (max) 的 pass@1 低于 50%。
⚡ 今天就能用
在依赖编码代理修复科学软件之前,可将 SWE-bench Science 作为压力测试。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。