SWE-Touch 在共享工作区中测试编程智能体
该基准发现,用户代码编辑会降低编程智能体在 SWE-bench Verified 上的问题解决率。
为什么重要
这项工作凸显了常见仓库级编程基准与真实共享工作区开发之间的差距。它表明,当人类在同一工作区内编辑代码时,编程智能体可能难以跟踪不断变化的代码。
核心要点
- 1.SWE-Touch 会在编程智能体任务中注入合理但相互冲突的用户编辑。
- 2.九个编程模型在 SWE-bench Verified 上下降了 7.7 分。
- 3.失败与对动态变化工作区的感知能力有限有关。
研究人员推出了 SWE-Touch,这是一个用于测试编程智能体的基准框架,关注用户在任务进行中修改任务相关代码时智能体的表现。该框架使用经过验证的 Counter-Edits,即被描述为合理但会与任务完成发生冲突的用户改动,并配合上下文用户消息将其注入任务流程。在对九个编程模型进行的 SWE-bench Verified 评测中,Counter-Edits 使平均解决率下降了 7.7 个百分点;在 SWE-Bench Pro 和 DeepSWE 上也观察到了性能下滑。
⚡ 今天就能用
在依赖编程智能体进行协作式仓库工作之前,应加入共享工作区编辑测试。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。