ClawGym II, 에이전트 하네스를 위한 블랙박스 RL 겨냥
이 논문은 복잡한 하네스를 거쳐 에이전트를 학습시키기 위한 샌드박스 기반 롤아웃과 궤적 복원을 제안한다.
왜 중요한가
에이전트 하네스는 장기 과제에서 점점 더 중요해지고 있지만, 불투명한 다단계 하네스를 거쳐 모델을 학습시키는 일은 여전히 어렵다. 이 연구는 에이전트 시스템에서 강화학습을 더 확장 가능하고 일관되게 만들기 위한 인프라와 최적화 방법을 제시한다.
핵심 포인트
- 1.샌드박스 실행은 하네스 롤아웃을 대규모로 격리한다.
- 2.서빙 프록시는 하네스 내부를 노출하지 않고 모델 호출을 포착한다.
- 3.Prefix tree는 PPO와 GRPO에 쓰일 멀티턴 궤적을 재구성한다.
ClawGym II 논문은 복잡한 에이전트 하네스를 통해 범용 에이전트를 최적화하기 위한 통합 블랙박스 강화학습 프레임워크를 제시한다. 이 접근법은 대규모 동시 롤아웃을 위한 샌드박스 기반 실행, 모델 호출을 포착하기 위한 모델 경계의 서빙 프록시, 멀티턴 궤적을 재구성하는 prefix tree를 사용한다. 저자들은 복원된 트리 구조 위에서 최적화하도록 PPO와 GRPO를 모두 조정하고, 이질적인 하네스를 위한 mix-harness 학습을 도입한다.
⚡ 오늘 바로 활용
불투명하거나 이질적인 하네스를 거쳐 실행되는 에이전트용 RL 학습 루프를 설계하기 전에 이 논문을 읽어볼 만하다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersClawGym II: Exploring Black-Box RL on Agent HarnessAug 17, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구
HarnessRisk, 에이전트 하네스 안전 실패를 벤치마크하다
이 벤치마크는 에이전트 하네스의 단계별 공격을 테스트하며, 관련 연구는 작업별 프로비저닝을 살핀다.
arXiv cs.AI+1 outlet·7h ago
연구
Agent Lightning v1.0, harness 기반 agentic RL 겨냥
이 프레임워크는 임의의 agent harness를 강화학습 기반 post-training에 연결한다.
arXiv cs.AI+1 outlet·7h ago
연구
논문, LLM 간 메모리 이전 가능성 시험
연구진은 타깃 측 리더를 활용해 고정된 학습 메모리가 서로 다른 모델 백본 사이에서 어떻게 이동할 수 있는지 분석했다.
arXiv cs.AI+1 outlet·7h ago