AAI News Hub
연구Mon, August 17, 2026·2d ago2 sources corroborating

ClawGym II, 에이전트 하네스를 위한 블랙박스 RL 겨냥

이 논문은 복잡한 하네스를 거쳐 에이전트를 학습시키기 위한 샌드박스 기반 롤아웃과 궤적 복원을 제안한다.

왜 중요한가

에이전트 하네스는 장기 과제에서 점점 더 중요해지고 있지만, 불투명한 다단계 하네스를 거쳐 모델을 학습시키는 일은 여전히 어렵다. 이 연구는 에이전트 시스템에서 강화학습을 더 확장 가능하고 일관되게 만들기 위한 인프라와 최적화 방법을 제시한다.

핵심 포인트

  • 1.샌드박스 실행은 하네스 롤아웃을 대규모로 격리한다.
  • 2.서빙 프록시는 하네스 내부를 노출하지 않고 모델 호출을 포착한다.
  • 3.Prefix tree는 PPO와 GRPO에 쓰일 멀티턴 궤적을 재구성한다.

ClawGym II 논문은 복잡한 에이전트 하네스를 통해 범용 에이전트를 최적화하기 위한 통합 블랙박스 강화학습 프레임워크를 제시한다. 이 접근법은 대규모 동시 롤아웃을 위한 샌드박스 기반 실행, 모델 호출을 포착하기 위한 모델 경계의 서빙 프록시, 멀티턴 궤적을 재구성하는 prefix tree를 사용한다. 저자들은 복원된 트리 구조 위에서 최적화하도록 PPO와 GRPO를 모두 조정하고, 이질적인 하네스를 위한 mix-harness 학습을 도입한다.

오늘 바로 활용

불투명하거나 이질적인 하네스를 거쳐 실행되는 에이전트용 RL 학습 루프를 설계하기 전에 이 논문을 읽어볼 만하다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구