CalibForge, solver 행동으로 터미널 과제 난이도 보정
이 시스템은 5,431개 과제를 생성했으며 터미널·코딩 벤치마크 전반에서 agent 점수를 끌어올렸다.
왜 중요한가
이 연구는 터미널 agent 학습의 핵심 병목인 실행 가능하고 검증 가능하며 학습에 적절한 난이도의 과제 생성 문제를 겨냥한다. Terminal-Bench 2.0, SWE-bench Pro, Doc2Repo에서 보고된 성과는 solver 기준의 과제 보정이 단순 검증을 넘어 supervision을 개선할 수 있음을 시사한다.
핵심 포인트
- 1.CalibForge는 보정된 터미널 과제 5,431개를 생성했다.
- 2.이 접근법은 solver 행동을 활용해 과제 난이도를 수정한다.
- 3.Doc2Repo에서 최대 30.04포인트의 성과 향상이 보고됐다.
연구진은 검증된 solver 행동을 활용해 터미널 agent 학습 과제를 합성하는 자율 시스템 CalibForge를 소개했다. 이 방법은 여러 solver 간 불일치와 strong-pass/weak-fail 대조 보정을 포함한 적대적 solver 보정을 통해 후보 과제를 수정한다. CalibForge는 보정된 터미널 과제 5,431개를 만들었고, 이 데이터로 학습한 모델들은 Terminal-Bench 2.0에서 32.58%와 47.57%를 기록했다.
⚡ 오늘 바로 활용
터미널 agent 학습 데이터를 설계하거나 실행 가능 검증에만 의존하기 전에 CalibForge 논문을 검토하라.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
Google, 동형암호로 프라이빗 AI 진전
Google은 동형암호를 활용해 프라이빗 AI를 더 실용적으로 만들고 있다고 밝혔다.
Google, private AI를 실용화하고 있다고 밝혀
Google Security 게시물이 Hacker News에서 논의를 불러왔고, 더 넓은 AI 비판과도 맞물렸다.
연구진, 통제된 LLM 연구용 LittleLearner 공개
50억 개 파라미터 모델로, 초등학교 5학년 이하 수준의 커리큘럼 말뭉치 880억 토큰으로 학습됐다.