SWE-Touch teste les agents de codage dans des espaces de travail partagés
Le benchmark montre que les contre-modifications des utilisateurs réduisent les taux de résolution des agents de codage sur SWE-bench Verified.
Pourquoi c'est important
Ces travaux mettent en évidence l’écart entre les benchmarks de codage en agent solo et le développement collaboratif réel, où le code peut évoluer pendant qu’un agent travaille. Ils suggèrent que les agents de codage doivent mieux comprendre les espaces de travail en évolution avant de pouvoir être utilisés de manière fiable dans des dépôts partagés.
Points clés
- 1.SWE-Touch cible les modifications utilisateur pendant les tâches des agents de codage.
- 2.Les Counter-Edits ont réduit le taux moyen de résolution de 7,7 points.
- 3.Les échecs étaient liés à une compréhension limitée des espaces de travail en évolution.
Des chercheurs ont présenté SWE-Touch, un cadre destiné à évaluer les agents de codage lorsque des utilisateurs inspectent et modifient le code pendant une tâche en cours. Il injecte des Counter-Edits validés, décrits comme des changements de code plausibles et pertinents pour la tâche, mais entrant en conflit avec son achèvement, ainsi que des messages utilisateur contextuels. Lors de tests menés sur neuf modèles de codage, Counter-Edit a fait baisser le taux moyen de résolution de 7,7 points de pourcentage sur SWE-bench Verified, avec une dégradation également observée sur SWE-Bench Pro et DeepSWE.
⚡ À tester aujourd'hui
Utilisez des tests de type SWE-Touch pour auditer les agents de codage avant de vous y fier dans des espaces de travail partagés.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.
Les outils et pratiques de développement IA suscitent le débat sur Hacker News
Des publications sur MathCode, les habitudes de codage avec l’IA, Cloudflare et HEIR de Google ont alimenté les discussions.
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.