SWE-bench Science, 과학 코드로 코딩 에이전트 성능 시험
이 벤치마크는 20개 과학 분야의 98개 GitHub 저장소에서 가져온 119개 과제로 구성됐다.
왜 중요한가
과학 소프트웨어는 연구 결론의 근거가 되는 증거에 직접 영향을 미칠 수 있어, 수정 품질의 중요성이 일반적인 코드 벤치마크가 포착하는 수준을 넘어선다. 이번 결과는 현재 코딩 에이전트가 특정 분야 저장소에서 과학 지식, 탐색, 통합, 일반화 측면에서 여전히 어려움을 겪고 있음을 시사한다.
핵심 포인트
- 1.119개 과제는 98개 저장소와 20개 과학 분야에 걸쳐 있다.
- 2.Claude Code with Opus-5 (max)는 pass@1 50% 미만을 기록했다.
- 3.실패 요인에는 도메인 지식, 탐색, 통합, 일반화의 한계가 포함된다.
연구진이 과학 소프트웨어 엔지니어링 과제에서 코딩 에이전트를 평가하기 위한 저장소 단위 벤치마크 SWE-bench Science를 공개했다. 이 벤치마크는 20개 과학 분야의 98개 GitHub 저장소에서 가져온 119개 과제로 이뤄졌으며, Issue-driven, Expert-exploratory, Engineering-integration 세 가지 유형으로 구성된다. 보고서에 따르면 최고 성능을 보인 에이전트인 Claude Code with Opus-5 (max)도 pass@1이 50% 미만에 그쳤다.
⚡ 오늘 바로 활용
과학 소프트웨어 수정을 코딩 에이전트에 맡기기 전 SWE-bench Science를 스트레스 테스트로 활용해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
MemTrapBench, LLM 메모리 활용의 인지적 함정 검증
이 벤치마크는 검색된 기록이 관련성이 있더라도 메모리가 작업 성능을 떨어뜨릴 수 있음을 보여준다.
AI4AI-Bench, 훈련 알고리즘 설계 능력으로 에이전트 평가
arXiv 벤치마크가 LLM 에이전트가 고정된 리포지토리에서 훈련 알고리즘을 재작성할 수 있는지를 평가한다.
새 논문들, 장문맥 AI 위한 sparse attention에 주목
연구진이 장문맥 추론, 서빙, 영상 생성, 메모리를 더 저렴하게 만드는 방법을 제안했다.