AAI News Hub
연구Fri, August 7, 2026·6d ago2 sources corroborating

새 논문들, 에이전트형 RL에서 자기 증류 검증

AgentOPSD와 OCSD는 개선책을 제안했고, 또 다른 연구는 특권 정보를 가진 교사가 더 어려운 과제에서 실패할 수 있다고 지적했다.

왜 중요한가

이 논문들은 기여도 할당과 편향된 특권 지도 신호가 에이전트형 RL에서 아직 풀리지 않은 핵심 문제임을 보여준다. 또한 증류 손실이 낮아졌다는 사실만으로 에이전트가 더 나은 행동을 학습하고 있다고 보기에는 충분하지 않다는 점을 시사한다.

핵심 포인트

  • 1.AgentOPSD는 크리틱이나 추가 롤아웃 없이 턴 단위 기여도 할당을 겨냥한다.
  • 2.OCSD는 특권 관측 신호에서 리플레이 스캐폴드 혼선을 제거하려 한다.
  • 3.편향 연구는 자기 증류가 더 어려운 과제에서 검증 정확도를 떨어뜨릴 수 있다고 밝혔다.

세 편의 arXiv 논문이 희소한 강화학습 보상으로 언어 모델 에이전트를 훈련하기 위한 자기 증류 방법을 살펴봤다. AgentOPSD는 턴 단위 기여도 할당을 위해 크리틱이 필요 없는 재귀적 방법을 제안하고, Qwen2.5 3B 및 7B 모델을 사용해 ALFWorld, WebShop, Search-QA에서 평가 결과를 보고했다. OCSD는 미래 관측에서 비롯되는 지도 신호를 분리하기 위해 전체 리플레이 관점과 관측을 제거한 리플레이 관점을 대조하는 방식을 제안했다. 별도의 논문은 특권 정보에 조건화된 교사가 토큰당 손실은 낮출 수 있지만, 더 어려운 과제에서는 검증 정확도를 개선하지 못하고 오히려 떨어뜨리는 경우가 많다고 주장했다.

오늘 바로 활용

OPSD식 자기 증류를 도입하기 전에, 어려운 홀드아웃 에이전트 과제에서 검증하고 토큰 손실뿐 아니라 과제 정확도도 추적해야 한다.

출처 및 원본 보도

이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.

이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.

관련: 연구