AAI News Hub
연구Thu, August 6, 2026·Aug 62 sources corroborating

CalibForge, solver 행동으로 터미널 과제 난이도 보정

이 시스템은 5,431개 과제를 생성했으며 터미널·코딩 벤치마크 전반에서 agent 점수를 끌어올렸다.

왜 중요한가

이 연구는 터미널 agent 학습의 핵심 병목인 실행 가능하고 검증 가능하며 학습에 적절한 난이도의 과제 생성 문제를 겨냥한다. Terminal-Bench 2.0, SWE-bench Pro, Doc2Repo에서 보고된 성과는 solver 기준의 과제 보정이 단순 검증을 넘어 supervision을 개선할 수 있음을 시사한다.

핵심 포인트

  • 1.CalibForge는 보정된 터미널 과제 5,431개를 생성했다.
  • 2.이 접근법은 solver 행동을 활용해 과제 난이도를 수정한다.
  • 3.Doc2Repo에서 최대 30.04포인트의 성과 향상이 보고됐다.

연구진은 검증된 solver 행동을 활용해 터미널 agent 학습 과제를 합성하는 자율 시스템 CalibForge를 소개했다. 이 방법은 여러 solver 간 불일치와 strong-pass/weak-fail 대조 보정을 포함한 적대적 solver 보정을 통해 후보 과제를 수정한다. CalibForge는 보정된 터미널 과제 5,431개를 만들었고, 이 데이터로 학습한 모델들은 Terminal-Bench 2.0에서 32.58%와 47.57%를 기록했다.

오늘 바로 활용

터미널 agent 학습 데이터를 설계하거나 실행 가능 검증에만 의존하기 전에 CalibForge 논문을 검토하라.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구