AAI News Hub
PesquisaFri, August 21, 2026·3h ago2 sources corroborating

SWE-bench Science testa agentes de programação em código científico

O benchmark inclui 119 tarefas de 98 repositórios do GitHub em 20 domínios científicos.

Por que importa

Software científico pode afetar diretamente as evidências por trás de conclusões de pesquisa, tornando a qualidade dos reparos mais relevante do que benchmarks comuns de código conseguem captar. Os resultados sugerem que os agentes de programação atuais ainda têm dificuldade com conhecimento científico, exploração, integração e generalização em repositórios específicos de cada domínio.

Pontos-chave

  • 1.As 119 tarefas abrangem 98 repositórios e 20 domínios científicos.
  • 2.Claude Code com Opus-5 (max) ficou abaixo de 50% em pass@1.
  • 3.As falhas incluem lacunas em conhecimento de domínio, exploração, integração e generalização.

Pesquisadores apresentaram o SWE-bench Science, um benchmark em nível de repositório para avaliar agentes de programação em tarefas de engenharia de software científico. O benchmark reúne 119 tarefas de 98 repositórios do GitHub em 20 domínios científicos, organizadas nos paradigmas Issue-driven, Expert-exploratory e Engineering-integration. O relatório afirma que o agente com melhor desempenho, Claude Code com Opus-5 (max), alcançou pass@1 abaixo de 50%.

Experimente hoje

Use o SWE-bench Science como teste de estresse antes de depender de agentes de programação para reparar software científico.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa