SWE-bench Science testa agentes de programação em código científico
O benchmark inclui 119 tarefas de 98 repositórios do GitHub em 20 domínios científicos.
Por que importa
Software científico pode afetar diretamente as evidências por trás de conclusões de pesquisa, tornando a qualidade dos reparos mais relevante do que benchmarks comuns de código conseguem captar. Os resultados sugerem que os agentes de programação atuais ainda têm dificuldade com conhecimento científico, exploração, integração e generalização em repositórios específicos de cada domínio.
Pontos-chave
- 1.As 119 tarefas abrangem 98 repositórios e 20 domínios científicos.
- 2.Claude Code com Opus-5 (max) ficou abaixo de 50% em pass@1.
- 3.As falhas incluem lacunas em conhecimento de domínio, exploração, integração e generalização.
Pesquisadores apresentaram o SWE-bench Science, um benchmark em nível de repositório para avaliar agentes de programação em tarefas de engenharia de software científico. O benchmark reúne 119 tarefas de 98 repositórios do GitHub em 20 domínios científicos, organizadas nos paradigmas Issue-driven, Expert-exploratory e Engineering-integration. O relatório afirma que o agente com melhor desempenho, Claude Code com Opus-5 (max), alcançou pass@1 abaixo de 50%.
⚡ Experimente hoje
Use o SWE-bench Science como teste de estresse antes de depender de agentes de programação para reparar software científico.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
MemTrapBench testa armadilhas cognitivas no uso de memória por LLMs
O benchmark mostra que a memória pode prejudicar o desempenho em tarefas mesmo quando os registros recuperados são relevantes.
AI4AI-Bench testa agentes no design de algoritmos de treinamento
O benchmark no arXiv avalia se agentes de LLM conseguem reescrever algoritmos de treinamento em repositórios congelados.
Novos artigos miram atenção esparsa para IA de contexto longo
Pesquisadores propõem métodos para inferência, serving, geração de vídeo e memória em contexto longo com menor custo.