AAI News Hub
研究Tue, August 4, 2026·Aug 42 sources corroborating

SWE-Touch、共有ワークスペースでコーディングエージェントを検証

このベンチマークは、ユーザーによる逆方向の編集がSWE-bench Verifiedでコーディングエージェントの解決率を下げることを示した。

なぜ重要か

この研究は、単独エージェント向けのコーディングベンチマークと、エージェントの作業中にもコードが変わり得る実際の共同開発との隔たりを浮き彫りにしている。共有リポジトリで確実に使えるようになるには、コーディングエージェントが変化するワークスペースをより的確に把握する必要があることを示唆している。

要点

  • 1.SWE-Touchは、コーディングエージェントのタスク中に行われるユーザー編集を対象にしている。
  • 2.Counter-Editsにより平均解決率は7.7ポイント低下した。
  • 3.失敗は、変化するワークスペースへの認識不足と関連していた。

研究者らは、進行中のタスクでユーザーがコードを確認・修正する状況におけるコーディングエージェントを評価するフレームワーク「SWE-Touch」を発表した。SWE-Touchは、タスクに関連していそうでありながら完了を妨げるコード変更として説明される、検証済みのCounter-Editsと、文脈に応じたユーザーメッセージを挿入する。9つのコーディングモデルを対象にしたテストでは、Counter-EditによりSWE-bench Verifiedで平均解決率が7.7ポイント低下し、SWE-Bench ProとDeepSWEでも性能低下が報告された。

今日から使える

共有ワークスペースでコーディングエージェントに頼る前に、SWE-Touch型のテストで監査するべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究