AAI News Hub
PesquisaTue, August 4, 2026·Aug 42 sources corroborating

SWE-Touch testa agentes de programação em workspaces compartilhados

O benchmark mostra que contraedições de usuários reduzem as taxas de resolução de agentes de programação no SWE-bench Verified.

Por que importa

O trabalho evidencia uma lacuna entre benchmarks de programação com agentes atuando sozinhos e o desenvolvimento colaborativo real, em que o código pode mudar enquanto um agente está trabalhando. Ele sugere que agentes de programação precisam de maior consciência de workspaces em evolução antes de poderem ser usados com confiabilidade em repositórios compartilhados.

Pontos-chave

  • 1.O SWE-Touch mira edições de usuários durante tarefas de agentes de programação.
  • 2.Counter-Edits reduziram a taxa média de resolução em 7,7 pontos.
  • 3.As falhas foram associadas a uma consciência limitada de workspaces em evolução.

Pesquisadores apresentaram o SWE-Touch, um framework para avaliar agentes de programação quando usuários inspecionam e modificam código durante uma tarefa em andamento. Ele injeta Counter-Edits validadas, descritas como mudanças de código plausíveis e relevantes para a tarefa que entram em conflito com sua conclusão, junto com mensagens contextuais do usuário. Em testes com nove modelos de programação, o Counter-Edit reduziu a taxa média de resolução em 7,7 pontos percentuais no SWE-bench Verified, com piora também relatada no SWE-Bench Pro e no DeepSWE.

Experimente hoje

Use testes no estilo SWE-Touch para auditar agentes de programação antes de depender deles em workspaces compartilhados.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa