SWE-Touch、共有ワークスペースでコーディングエージェントを検証
このベンチマークは、ユーザーによる逆方向の編集がSWE-bench Verifiedでコーディングエージェントの解決率を下げることを示した。
なぜ重要か
この研究は、単独エージェント向けのコーディングベンチマークと、エージェントの作業中にもコードが変わり得る実際の共同開発との隔たりを浮き彫りにしている。共有リポジトリで確実に使えるようになるには、コーディングエージェントが変化するワークスペースをより的確に把握する必要があることを示唆している。
要点
- 1.SWE-Touchは、コーディングエージェントのタスク中に行われるユーザー編集を対象にしている。
- 2.Counter-Editsにより平均解決率は7.7ポイント低下した。
- 3.失敗は、変化するワークスペースへの認識不足と関連していた。
研究者らは、進行中のタスクでユーザーがコードを確認・修正する状況におけるコーディングエージェントを評価するフレームワーク「SWE-Touch」を発表した。SWE-Touchは、タスクに関連していそうでありながら完了を妨げるコード変更として説明される、検証済みのCounter-Editsと、文脈に応じたユーザーメッセージを挿入する。9つのコーディングモデルを対象にしたテストでは、Counter-EditによりSWE-bench Verifiedで平均解決率が7.7ポイント低下し、SWE-Bench ProとDeepSWEでも性能低下が報告された。
⚡ 今日から使える
共有ワークスペースでコーディングエージェントに頼る前に、SWE-Touch型のテストで監査するべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
AI開発者ツールと実践をめぐりHacker Newsで議論
MathCode、AIコーディングの習慣、Cloudflare、GoogleのHEIRに関する投稿が議論を呼んだ。
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。