研究人员探讨 OPSD 中的特权信息
新论文考察仅在训练阶段可用的指导如何助益或损害语言模型自蒸馏。
为什么重要
这些研究凸显出,特权信息设计是语言模型后训练中的核心问题。它表明,更丰富的指导可以提升蒸馏效果,但过于具体或推理时不可获得的训练时信息,可能削弱模型在推理阶段的表现。
核心要点
- 1.对于开放式生成,rubrics 可能比参考答案提供更强的蒸馏信号。
- 2.DAPD 针对由师生信息不对称引发的 privilege illusion。
- 3.PS-OPSD 报告称,使用问题结构指导可提升仅看题目条件下的数学准确率。
三篇新的 arXiv 论文研究了 on-policy self-distillation(OPSD),这是一种后训练方法:模型利用带有特权信息的教师视角来监督学生视角。其中一篇论文认为,在开放式生成任务中,rubrics 可作为密集的特权信息,并在 HealthBench 上优于将 rubric 作为奖励的强化学习方法。另两篇论文则指出了信息不对称带来的风险:DAPD 通过双重锚定应对“privilege illusion”,而 PS-OPSD 在数学推理中用问题结构指导取代完整解题轨迹。
⚡ 今天就能用
审查 OPSD 流程中学生在推理时无法访问的特权信息,并在使用完整参考答案之前,先测试 rubric 或问题结构指导。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- HF Daily PapersDAPD: Dual-Anchored Policy DistillationAug 3, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。