on-policy distillation
概念词在线策略蒸馏
🔍 Google 联想 10 📄 arxiv 10 篇 💬 HN 2 条 📅 首次出现 2026-08-27
🧠 on-policy distillation 是什么
On-policy distillation(在线策略蒸馏)回答强化学习训练中的"数据从哪来"问题。传统蒸馏用固定数据集(offline),而在线策略蒸馏用"当前正在训练的策略"实时生成的数据来训练:模型边学边产出训练样本,样本质量随模型进步而提升。
在 RLVR 多能力融合的语境下,它表现为 Multi-Teacher On-Policy Distillation(MOPD):多个单领域专家各自实时生成数据,一个学生模型同时向它们学习,再配合参数合并(Merge)与数据集混合(Mix RL)做横向对比。2026 年的研究结论是:三种范式各有适用场景,融合使用最稳。
🔥 为什么现在火
RLVR 融合研究(多教师在线策略蒸馏 MOPD)确定混合范式;Thinking Machines 等也在推进。
📄 证据链(交叉验证)
🔍 搜索形态
on-policy distillation on-policy distillation LLM
on-policy distillation 常见问题 FAQ
on-policy distillation 是什么?+
用当前策略实时生成的数据训练学生模型(区别于固定数据集),使训练数据随模型进步持续更新。
on-policy 和 off-policy 蒸馏哪个好?+
没有绝对胜负:on-policy 数据新鲜、与当前策略分布一致,成本更高;off-policy 便宜但可能分布偏移,工程上常混合使用。
与 on-policy distillation 相关的搜索
人们搜索 on-policy distillation 时,还会关心这些问题:
- on-policy distillation 是什么
- 什么是 on-policy distillation
- on-policy distillation 是什么意思
- 在线策略蒸馏 是什么
- 在线策略蒸馏 详解
- on-policy distillation 原理
- on-policy distillation 怎么工作
- on-policy distillation 有什么用
- on-policy distillation 应用场景
- on-policy distillation 为什么火
- 为什么 on-policy distillation 重要
- on-policy distillation 和 verifiable-rewards 的区别
- on-policy distillation 2026