새 논문들, 에이전트형 RL에서 자기 증류 검증
AgentOPSD와 OCSD는 개선책을 제안했고, 또 다른 연구는 특권 정보를 가진 교사가 더 어려운 과제에서 실패할 수 있다고 지적했다.
왜 중요한가
이 논문들은 기여도 할당과 편향된 특권 지도 신호가 에이전트형 RL에서 아직 풀리지 않은 핵심 문제임을 보여준다. 또한 증류 손실이 낮아졌다는 사실만으로 에이전트가 더 나은 행동을 학습하고 있다고 보기에는 충분하지 않다는 점을 시사한다.
핵심 포인트
- 1.AgentOPSD는 크리틱이나 추가 롤아웃 없이 턴 단위 기여도 할당을 겨냥한다.
- 2.OCSD는 특권 관측 신호에서 리플레이 스캐폴드 혼선을 제거하려 한다.
- 3.편향 연구는 자기 증류가 더 어려운 과제에서 검증 정확도를 떨어뜨릴 수 있다고 밝혔다.
세 편의 arXiv 논문이 희소한 강화학습 보상으로 언어 모델 에이전트를 훈련하기 위한 자기 증류 방법을 살펴봤다. AgentOPSD는 턴 단위 기여도 할당을 위해 크리틱이 필요 없는 재귀적 방법을 제안하고, Qwen2.5 3B 및 7B 모델을 사용해 ALFWorld, WebShop, Search-QA에서 평가 결과를 보고했다. OCSD는 미래 관측에서 비롯되는 지도 신호를 분리하기 위해 전체 리플레이 관점과 관측을 제거한 리플레이 관점을 대조하는 방식을 제안했다. 별도의 논문은 특권 정보에 조건화된 교사가 토큰당 손실은 낮출 수 있지만, 더 어려운 과제에서는 검증 정확도를 개선하지 못하고 오히려 떨어뜨리는 경우가 많다고 주장했다.
⚡ 오늘 바로 활용
OPSD식 자기 증류를 도입하기 전에, 어려운 홀드아웃 에이전트 과제에서 검증하고 토큰 손실뿐 아니라 과제 정확도도 추적해야 한다.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.