AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

on-policy distillation

概念词

在线策略蒸馏

🔍 Google 联想 10 📄 arxiv 10 篇 💬 HN 2 条 📅 首次出现 2026-08-27

🧠 on-policy distillation 是什么

On-policy distillation(在线策略蒸馏)回答强化学习训练中的"数据从哪来"问题。传统蒸馏用固定数据集(offline),而在线策略蒸馏用"当前正在训练的策略"实时生成的数据来训练:模型边学边产出训练样本,样本质量随模型进步而提升。

在 RLVR 多能力融合的语境下,它表现为 Multi-Teacher On-Policy Distillation(MOPD):多个单领域专家各自实时生成数据,一个学生模型同时向它们学习,再配合参数合并(Merge)与数据集混合(Mix RL)做横向对比。2026 年的研究结论是:三种范式各有适用场景,融合使用最稳。

🔥 为什么现在火

RLVR 融合研究(多教师在线策略蒸馏 MOPD)确定混合范式;Thinking Machines 等也在推进。

📄 证据链(交叉验证)

🔍 搜索形态

on-policy distillation on-policy distillation LLM

on-policy distillation 常见问题 FAQ

on-policy distillation 是什么?+

用当前策略实时生成的数据训练学生模型(区别于固定数据集),使训练数据随模型进步持续更新。

on-policy 和 off-policy 蒸馏哪个好?+

没有绝对胜负:on-policy 数据新鲜、与当前策略分布一致,成本更高;off-policy 便宜但可能分布偏移,工程上常混合使用。

与 on-policy distillation 相关的搜索

人们搜索 on-policy distillation 时,还会关心这些问题:

  • on-policy distillation 是什么
  • 什么是 on-policy distillation
  • on-policy distillation 是什么意思
  • 在线策略蒸馏 是什么
  • 在线策略蒸馏 详解
  • on-policy distillation 原理
  • on-policy distillation 怎么工作
  • on-policy distillation 有什么用
  • on-policy distillation 应用场景
  • on-policy distillation 为什么火
  • 为什么 on-policy distillation 重要
  • on-policy distillation 和 verifiable-rewards 的区别
  • on-policy distillation 2026

相关词条

更多概念词:同类新词