AAI News Hub
연구Wed, August 19, 2026·1d ago2 sources corroborating

연구진, 에이전트 하네스를 위한 RL 프레임워크 제안

LEGO-RL과 ClawGym II는 장기 실행 AI 에이전트를 위한 안정적인 강화학습을 목표로 한다.

왜 중요한가

이 연구는 AI 에이전트 훈련의 핵심 문제를 다룬다. 하네스는 장기 과제 수행 능력을 높이지만, 충돌과 불투명한 실행, 학습-추론 불일치가 RL 신호를 왜곡할 수 있다. 더 신뢰할 수 있는 하네스 네이티브 RL은 에이전트 최적화를 실제 배포 환경의 동작과 더 잘 맞추는 데 기여할 수 있다.

핵심 포인트

  • 1.LEGO-RL은 코딩 에이전트 하네스 훈련을 겨냥한다.
  • 2.ClawGym II는 범용 에이전트를 위한 블랙박스 RL을 제안한다.
  • 3.두 프레임워크 모두 프록시와 샌드박스를 활용해 롤아웃을 안정화한다.

새로 공개된 두 편의 arXiv 논문은 복잡하고 장시간 실행되는 하네스 안에서 작동하는 에이전트에 강화학습을 적용하는 프레임워크를 설명한다. LEGO-RL은 코딩 에이전트에 초점을 맞춰, 인프로세스 LLM 프록시, 샌드박스 오케스트레이션, 검증 및 모니터링 도구, 실시간 UI를 활용해 정책 경사 학습을 네이티브 하네스 실행과 정렬한다. ClawGym II는 범용 에이전트를 위한 블랙박스 RL 프레임워크로, 샌드박스 기반 병렬 롤아웃, 모델 경계 서빙 프록시, prefix-tree 궤적 재구성, PPO 및 GRPO 적응 방식을 사용한다.

오늘 바로 활용

코딩 에이전트나 범용 에이전트 하네스를 기반으로 RL 파이프라인을 구축하기 전에 두 논문을 모두 읽어보라.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구