연구진, 온폴리시 증류를 표준 교사 모델의 한계 너머로 확장
새 arXiv 논문들이 생성기, 에이전트, VLM, LLM 전반에서 OPD의 한계를 겨냥하고 있다.
왜 중요한가
이 연구들은 OPD가 교사와 학생 모델의 아키텍처, 모달리티, 용량, 궤적 동역학이 서로 다를 때도 행동을 이전하는 더 폭넓은 도구로 발전하고 있음을 보여준다. 이는 더 크고 구조가 밀접하게 맞는 교사 모델 없이도 소형 모델이나 특화 모델을 배포하는 데 중요할 수 있다.
핵심 포인트
- 1.Any-OPD는 비전 표현을 통해 서로 맞지 않는 flow-matching 생성기들을 연결한다.
- 2.FutureBridge-OPD는 교사 모델의 지도를 이후 에이전트 궤적과 대조해 검증한다.
- 3.Weak-to-strong 및 Fisher-projected 변형은 용량 불일치를 겨냥한다.
최근 여러 arXiv 논문은 학생 모델이 스스로 생성한 상태나 샘플을 바탕으로 학습하는 온폴리시 증류의 핵심 가정을 완화하는 방법을 제안했다. Any-OPD는 서로 다른 모델 계열의 잠재 flow-matching 생성기를 대상으로, 독립적으로 디코딩한 출력을 고정된 비전 표현에서 비교한다. FutureBridge-OPD는 교사 모델의 지도가 이후 에이전트 궤적에 미치는 영향을 시험해 그 유효성을 검증한다. 다른 논문들은 더 약한 모델 쌍에서 강한 학생 모델을 증류하거나, 비전-언어 교사 모델의 교정을 소형 학생 모델이 국소적으로 표현할 수 있는 범위에 투영하는 방식을 제안한다.
⚡ 오늘 바로 활용
OPD를 도입하기 전에 교사와 학생 모델이 잠재 공간, 스케줄, 용량, 궤적 행동을 공유하는지 확인하고, 불일치에 맞게 설계된 방법을 선택하라.
출처 및 원본 보도
이 브리핑은 아래 매체의 보도를 요약하고 링크합니다.
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
이 브리핑이 유용했나요? 다음 소식을 메일로 받아보세요.
관련: 연구
연구진, 동영상 반사 제거를 위한 확산 모델 제안
S2R은 물리 기반 반사 시뮬레이션과 확산형 동영상 제거 모델 및 벤치마크를 결합했다.
논문, 에이전트 안전에는 런타임 계약이 필요하다고 주장
arXiv 논문은 자율 에이전트에 훈련 시점의 정렬만으로는 충분하지 않다고 말한다.
연구진, 더 약한 모델을 위한 AI 제작 하네스 테스트
더 강한 모델이 추론 시점의 스캐폴드를 만들어 Theory-of-Mind 벤치마크에서 약한 모델의 점수를 끌어올렸다.