SWE-Touch, 공유 작업공간에서 코딩 에이전트를 시험하다
이 벤치마크는 사용자의 역방향 수정이 SWE-bench Verified에서 코딩 에이전트의 해결률을 낮춘다는 점을 보여준다.
왜 중요한가
이번 연구는 단독 에이전트 중심의 코딩 벤치마크와 실제 협업 개발 환경 사이의 간극을 부각한다. 실제 환경에서는 에이전트가 작업하는 동안에도 코드가 바뀔 수 있기 때문이다. 이는 코딩 에이전트가 공유 저장소에서 안정적으로 쓰이려면 변화하는 작업공간을 더 잘 인식해야 함을 시사한다.
핵심 포인트
- 1.SWE-Touch는 코딩 에이전트 작업 중 발생하는 사용자 수정을 겨냥한다.
- 2.Counter-Edits는 평균 해결률을 7.7%포인트 낮췄다.
- 3.실패는 변화하는 작업공간에 대한 제한적인 인식과 관련이 있었다.
연구진은 사용자가 진행 중인 작업에서 코드를 검토하고 수정하는 상황을 기준으로 코딩 에이전트를 평가하는 프레임워크인 SWE-Touch를 공개했다. 이 프레임워크는 작업 완료와 충돌하지만 그럴듯하고 작업과 관련된 코드 변경으로 설명되는 검증된 Counter-Edits와 맥락을 담은 사용자 메시지를 함께 주입한다. 9개 코딩 모델을 대상으로 한 테스트에서 Counter-Edit는 SWE-bench Verified의 평균 해결률을 7.7%포인트 낮췄으며, SWE-Bench Pro와 DeepSWE에서도 성능 저하가 보고됐다.
⚡ 오늘 바로 활용
공유 작업공간에서 코딩 에이전트에 의존하기 전에 SWE-Touch 방식의 테스트로 이를 점검해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
InternLM, Mobius 모델 아키텍처 제안
arXiv 논문은 압축률과 추론 효율을 높이기 위해 메모리와 추론을 분리했다.
연구진, 시각 문서 검색 병목 해소에 주목
VISOR와 ConceptFormer가 시각 요소가 풍부한 문서를 대상으로 한 멀티모달 검색의 새로운 방법론을 제안했다.
R^3-Bench, 공유 예산에서 LLM 추론 능력 시험
이 벤치마크는 제한된 계산 자원 안에서 여섯 개 모델을 여러 문제 묶음으로 평가한다.