SWE-Touch testa agentes de programação em workspaces compartilhados
O benchmark mostra que contraedições de usuários reduzem as taxas de resolução de agentes de programação no SWE-bench Verified.
Por que importa
O trabalho evidencia uma lacuna entre benchmarks de programação com agentes atuando sozinhos e o desenvolvimento colaborativo real, em que o código pode mudar enquanto um agente está trabalhando. Ele sugere que agentes de programação precisam de maior consciência de workspaces em evolução antes de poderem ser usados com confiabilidade em repositórios compartilhados.
Pontos-chave
- 1.O SWE-Touch mira edições de usuários durante tarefas de agentes de programação.
- 2.Counter-Edits reduziram a taxa média de resolução em 7,7 pontos.
- 3.As falhas foram associadas a uma consciência limitada de workspaces em evolução.
Pesquisadores apresentaram o SWE-Touch, um framework para avaliar agentes de programação quando usuários inspecionam e modificam código durante uma tarefa em andamento. Ele injeta Counter-Edits validadas, descritas como mudanças de código plausíveis e relevantes para a tarefa que entram em conflito com sua conclusão, junto com mensagens contextuais do usuário. Em testes com nove modelos de programação, o Counter-Edit reduziu a taxa média de resolução em 7,7 pontos percentuais no SWE-bench Verified, com piora também relatada no SWE-Bench Pro e no DeepSWE.
⚡ Experimente hoje
Use testes no estilo SWE-Touch para auditar agentes de programação antes de depender deles em workspaces compartilhados.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.