AI 新词情报站 — 追踪 AI 领域新概念与新工具,每个词条都有论文、代码、社区讨论构成的交叉验证证据链

knowledge distillation

概念词 📚 基础词库 · 存量热词

知识蒸馏

🔍 Google 联想 10 📅 首次出现 2026-08-28

🧠 knowledge distillation 是什么

知识蒸馏(Knowledge Distillation)由 Hinton 等人在 2015 年论文《Distilling the Knowledge in a Neural Network》中提出。核心思想是让一个小模型(学生)模仿大模型(教师)的输出,从而继承其知识与能力。

关键技巧是使用「软标签」——教师模型输出的概率分布——来训练学生模型,因为概率分布中包含了类别间相似度等「暗知识」,比真实标签信息量更大。蒸馏后的模型通常更小、推理更快,精度接近大模型。

在 LLM 时代,蒸馏被广泛用于模型压缩与数据合成:如用 GPT-4 的输出训练小模型,Alpaca、Vicuna 等开源模型也使用了「用强模型生成指令数据训练弱模型」的类似思想,让开源社区获得可本地部署的轻量模型。

🔥 为什么现在火

部署成本压力与开源小模型竞赛,让蒸馏成为「把大模型能力装进小模型」的主流手段,也是合成数据训练流水线的常见一环。

📄 证据链(交叉验证)

🔍 搜索形态

what is knowledge distillation knowledge distillation of LLMs knowledge distillation paper knowledge distillation survey

knowledge distillation 常见问题 FAQ

知识蒸馏的原理是什么?+

学生模型以教师模型的输出概率分布为目标进行训练,学会模仿教师的行为,而不是只拟合真实标签。

知识蒸馏有什么用?+

用于模型压缩和加速,把大模型能力迁移到小模型,便于在手机、边缘设备等资源受限环境部署。

与 knowledge distillation 相关的搜索

人们搜索 knowledge distillation 时,还会关心这些问题:

  • knowledge distillation 是什么
  • 什么是 knowledge distillation
  • knowledge distillation 是什么意思
  • knowledge distillation 原理
  • knowledge distillation 有什么用
  • knowledge distillation 应用场景
  • knowledge distillation 为什么火
  • knowledge distillation 2026

更多概念词:同类新词