研究人员改造 OPD,提升视频推理效率
两篇论文利用蒸馏技术,改进更小型或流式视频理解模型的表现。
为什么重要
这项工作瞄准了视频 AI 的一个核心瓶颈:如何在不依赖更大、更昂贵的模型,也不增加推理时记忆系统的情况下,提升对大量帧的推理能力。它还表明,在推理轨迹中如何应用蒸馏,可能与输出 token 监督同样重要。
核心要点
- 1.Latent-OPD 蒸馏的是轨迹级隐藏状态,而不只是输出 token。
- 2.StreamOPD 使用 thinking-mode OPD,但以 instruct mode 部署。
- 3.报告中的提升面向流式视频基准,且未改变推理方式。
两份报告介绍了用于视频推理和流式视频理解的后训练方法,这些方法采用 on-policy distillation。Latent-OPD 通过在推理轨迹末端,将学生模型的隐藏状态与教师模型的层对齐,引入轨迹级潜在蒸馏。StreamOPD 则结合可验证的流式视频数据、thinking-mode OPD 和 instruct-mode 部署,并报告在推理设置不变的情况下,在 StreamingBench 和 OVO-Bench 上取得提升。
⚡ 今天就能用
在为高效或流式视频理解系统选择蒸馏方案前,先审阅 Latent-OPD 和 StreamOPD 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。