AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

新论文检验用于 LLM 强化学习的自蒸馏方法

研究提出 ICE 和 OCSD;另有论文发现,掌握特权信息的教师模型在更难任务上可能失效。

为什么重要

这些论文指向了对 LLM 后训练中自蒸馏更细致的认识:当它与探索或校准结合时可能有帮助,但也可能只是在优化 token 级损失,而没有提升任务准确率。对于把密集监督作为更低成本替代方案,或作为基于奖励的强化学习补充手段的团队来说,这一点很重要。

核心要点

  • 1.ICE 使 Qwen3-1.7B 的数学 pass@1 相较 DAPO 提高了 5.0%。
  • 2.在 4K 设置下,Qwen3-4B 未出现论文报告的 ICE 收益。
  • 3.特权信息自蒸馏可能在降低损失的同时损害验证准确率。

近期多篇 arXiv 论文研究了用强化学习对大语言模型进行后训练时的自蒸馏方法。其中一篇提出 Instruction-Conditioned Exploration(ICE),通过加入固定训练指令,并将正确 rollout 蒸馏到测试时不带条件的策略中;论文称,在 4K 响应长度下,Qwen3-1.7B 的数学推理相较 DAPO 在留出集 pass@1 上取得 5.0% 的相对提升。另一篇提出面向智能体强化学习的 Observation-Calibrated Self-Distillation(OCSD)。第三篇则报告称,特权信息自蒸馏可以在简单设置中复现收益,但在更难的 QA、数学、编程和工具使用任务上,往往无法提升验证准确率,甚至可能导致下降。

今天就能用

在采用自蒸馏进行 LLM 后训练之前,应在困难的留出任务上验证效果,并跟踪准确率,而不只是关注逐 token 损失。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究