연구진, 터미널 에이전트 과제를 위한 RST 제안
Recursive Synthetic Terminal Tasks는 시드 과제에서 검증된 과제 37,484개를 생성했다.
왜 중요한가
이 연구는 터미널 에이전트 훈련의 병목, 즉 지시문과 환경, 해법, 검증기가 일관되게 맞물린 장기 지평 과제를 만드는 문제를 겨냥한다. 재현 가능하다면, 재귀적 검증 합성은 에이전트 훈련 세트와 더 어려운 평가 스위트를 구축하는 비용을 낮출 수 있다.
핵심 포인트
- 1.RST는 합성 터미널 에이전트 과제 37,484개를 생성했다.
- 2.보고된 비용은 과제당 약 0.05달러였다.
- 3.DeepSeek-V4-Pro의 pass@4는 라운드가 진행되며 90%에서 2.5%로 떨어졌다.
HF Daily Papers가 소개한 한 논문은 장기 지평 터미널 에이전트 훈련 과제를 생성하는 프레임워크인 Recursive Synthetic Terminal Tasks를 제시한다. RST는 검증된 시드 과제에서 출발해 참조 해법을 확장하고, 검증기와 지시문을 다시 정렬하며, 새로운 샌드박스에서 과제를 검증한 뒤, 승인된 과제를 이후 라운드에 재사용한다. 15차례의 재귀 라운드에 걸쳐 과제당 약 0.05달러의 비용으로 합성 과제 37,484개를 만들어냈으며, 라운드가 진행될수록 과제 난도가 높아졌다.
⚡ 오늘 바로 활용
터미널 에이전트 벤치마크나 합성 훈련 파이프라인을 만들기 전에 이 논문을 읽어볼 필요가 있다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGRecursive Synthesis for Long-Horizon Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.LGCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- arXiv cs.CLCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 7, 12:00 PM↗
- HF Daily PapersCalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal TasksAug 6, 4:00 AM↗
- HF Daily PapersRecursive Synthesis for Long-Horizon Terminal TasksAug 5, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.