AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

SWE-Touch teste les agents de codage dans des espaces de travail partagés

Le benchmark montre que les contre-modifications des utilisateurs réduisent les taux de résolution des agents de codage sur SWE-bench Verified.

Pourquoi c'est important

Ces travaux mettent en évidence l’écart entre les benchmarks de codage en agent solo et le développement collaboratif réel, où le code peut évoluer pendant qu’un agent travaille. Ils suggèrent que les agents de codage doivent mieux comprendre les espaces de travail en évolution avant de pouvoir être utilisés de manière fiable dans des dépôts partagés.

Points clés

  • 1.SWE-Touch cible les modifications utilisateur pendant les tâches des agents de codage.
  • 2.Les Counter-Edits ont réduit le taux moyen de résolution de 7,7 points.
  • 3.Les échecs étaient liés à une compréhension limitée des espaces de travail en évolution.

Des chercheurs ont présenté SWE-Touch, un cadre destiné à évaluer les agents de codage lorsque des utilisateurs inspectent et modifient le code pendant une tâche en cours. Il injecte des Counter-Edits validés, décrits comme des changements de code plausibles et pertinents pour la tâche, mais entrant en conflit avec son achèvement, ainsi que des messages utilisateur contextuels. Lors de tests menés sur neuf modèles de codage, Counter-Edit a fait baisser le taux moyen de résolution de 7,7 points de pourcentage sur SWE-bench Verified, avec une dégradation également observée sur SWE-Bench Pro et DeepSWE.

À tester aujourd'hui

Utilisez des tests de type SWE-Touch pour auditer les agents de codage avant de vous y fier dans des espaces de travail partagés.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche