AAI News Hub
InvestigaciónFri, August 21, 2026·3h ago2 sources corroborating

SWE-bench Science pone a prueba a los agentes de programación con código científico

El benchmark incluye 119 tareas de 98 repositorios de GitHub en 20 dominios científicos.

Por qué importa

El software científico puede afectar directamente la evidencia que sustenta las conclusiones de investigación, por lo que la calidad de las correcciones tiene consecuencias que los benchmarks de código ordinarios no llegan a captar. Los resultados sugieren que los agentes de programación actuales aún tienen dificultades con el conocimiento científico, la exploración, la integración y la generalización en repositorios específicos de dominio.

Puntos clave

  • 1.Las 119 tareas abarcan 98 repositorios y 20 dominios científicos.
  • 2.Claude Code con Opus-5 (max) obtuvo un pass@1 inferior al 50%.
  • 3.Los fallos incluyen brechas en conocimiento de dominio, exploración, integración y generalización.

Investigadores presentaron SWE-bench Science, un benchmark a nivel de repositorio para evaluar agentes de programación en tareas de ingeniería de software científico. El benchmark reúne 119 tareas de 98 repositorios de GitHub en 20 dominios científicos, organizadas en tres paradigmas: basadas en issues, exploración experta e integración de ingeniería. El informe señala que el agente con mejor desempeño, Claude Code con Opus-5 (max), logró un pass@1 inferior al 50%.

Pruébalo hoy

Use SWE-bench Science como prueba de estrés antes de confiar en agentes de programación para reparar software científico.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación