AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

SWE-Touch pone a prueba agentes de programación en espacios de trabajo compartidos

El benchmark concluye que las contraediciones de usuarios reducen las tasas de resolución de los agentes de programación en SWE-bench Verified.

Por qué importa

El trabajo pone de relieve una brecha entre los benchmarks de programación con agentes que trabajan en solitario y el desarrollo colaborativo real, donde el código puede cambiar mientras un agente está trabajando. Sugiere que los agentes de programación necesitan una mayor conciencia de los espacios de trabajo en evolución antes de poder usarse de forma fiable en repositorios compartidos.

Puntos clave

  • 1.SWE-Touch se centra en las ediciones de usuarios durante tareas de agentes de programación.
  • 2.Las Counter-Edits redujeron la tasa media de resolución en 7,7 puntos.
  • 3.Los fallos se asociaron con una conciencia limitada de los espacios de trabajo en evolución.

Investigadores presentaron SWE-Touch, un marco para evaluar agentes de programación cuando los usuarios revisan y modifican código durante una tarea en curso. El sistema introduce Counter-Edits validadas, descritas como cambios de código plausibles y relevantes para la tarea que entran en conflicto con su finalización, junto con mensajes contextuales del usuario. En pruebas con nueve modelos de programación, Counter-Edit redujo la tasa media de resolución en 7,7 puntos porcentuales en SWE-bench Verified; también se reportaron caídas en SWE-Bench Pro y DeepSWE.

Pruébalo hoy

Use pruebas al estilo de SWE-Touch para auditar agentes de programación antes de depender de ellos en espacios de trabajo compartidos.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación