SWE-bench Science pone a prueba a los agentes de programación con código científico
El benchmark incluye 119 tareas de 98 repositorios de GitHub en 20 dominios científicos.
Por qué importa
El software científico puede afectar directamente la evidencia que sustenta las conclusiones de investigación, por lo que la calidad de las correcciones tiene consecuencias que los benchmarks de código ordinarios no llegan a captar. Los resultados sugieren que los agentes de programación actuales aún tienen dificultades con el conocimiento científico, la exploración, la integración y la generalización en repositorios específicos de dominio.
Puntos clave
- 1.Las 119 tareas abarcan 98 repositorios y 20 dominios científicos.
- 2.Claude Code con Opus-5 (max) obtuvo un pass@1 inferior al 50%.
- 3.Los fallos incluyen brechas en conocimiento de dominio, exploración, integración y generalización.
Investigadores presentaron SWE-bench Science, un benchmark a nivel de repositorio para evaluar agentes de programación en tareas de ingeniería de software científico. El benchmark reúne 119 tareas de 98 repositorios de GitHub en 20 dominios científicos, organizadas en tres paradigmas: basadas en issues, exploración experta e integración de ingeniería. El informe señala que el agente con mejor desempeño, Claude Code con Opus-5 (max), logró un pass@1 inferior al 50%.
⚡ Pruébalo hoy
Use SWE-bench Science como prueba de estrés antes de confiar en agentes de programación para reparar software científico.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
MemTrapBench pone a prueba las trampas cognitivas en el uso de memoria por los LLM
El benchmark concluye que la memoria puede degradar el rendimiento en tareas incluso cuando los registros recuperados son relevantes.
AI4AI-Bench pone a prueba a los agentes en el diseño de algoritmos de entrenamiento
El benchmark publicado en arXiv evalúa si los agentes basados en LLM pueden reescribir algoritmos de entrenamiento en repositorios congelados.
Nuevos papers apuntan a la atención dispersa para la IA de contexto largo
Investigadores proponen métodos para abaratar la inferencia de contexto largo, el serving, la generación de video y la memoria.