AI 脉络GitHub ↗
术语库概念对比学习路径AI 雷达参与共建GitHub ↗
基础模型进阶基础概念

Knowledge Distillation

知识蒸馏 · 模型蒸馏 · 蒸馏 · Distillation · Teacher Student

用教师模型提供的输出或其他监督信号训练学生模型,让学生学习目标行为,常用于降低部署成本,但不保证复制教师的全部能力。

最后核验 2026-09-08 · 已核验

用一个类比理解

像老师把示范和判断方法整理给学生练习:学生能学会部分任务,但并不是把老师的大脑压缩后原样装进去。

这篇能帮你解决什么

带着目标读,读完可以验证

  • 区分概率分布蒸馏与基于生成文本的蒸馏
  • 解释蒸馏、微调和量化各自描述什么
开始深读 →先做一道自测 →查看 4 份来源 →

它解决什么

  • 把教师的部分任务表现迁移到学生模型
  • 为训练构造有信息量的监督信号
  • 在质量约束下探索更低的推理成本

它不是什么

  • 学生不一定必须比教师更小
  • 蒸馏不是把权重文件直接压缩
  • 蒸馏和微调可以发生在同一次训练中
  • 教师的回答也需要质量检查

适合使用

  • 已有可靠教师和可代表业务的数据
  • 明确需要降低特定任务的成本或延迟
  • 有独立评测集检验学生能力

暂时别用

  • 需求只是让系统访问最新文档
  • 任务和验收标准仍在频繁变化
  • 无法承担训练数据生成与评测成本

常见失败方式

  • 把教师错误一并教给学生
  • 训练集与评测集泄漏
  • 只比较参数量而不测真实延迟
  • 误以为模仿推理文本就复制了教师内部机制

学生到底在学什么#

知识蒸馏是一类利用教师模型监督学生训练的方法。经典方案让学生学习教师输出的软概率,而不只看一个正确类别;类别之间的相对概率也可能包含有用信息。1

对生成任务,也可以先由教师生成完整答案,再用这些序列训练学生。序列级蒸馏研究展示了这条路线,因此“没有拿到教师的完整概率分布”并不等于无法进行任何形式的蒸馏。2

教师与学生描述的是训练中的角色。压缩到更小的模型是常见目标,判断是否属于蒸馏更应看监督来自哪里,而不是只比较参数量。

蒸馏和微调不是同一维度#

微调描述在已有模型上继续训练;蒸馏强调从教师获取监督并迁移能力。用教师答案微调学生,可以同时属于二者。DeepSeek-R1 报告第 2.4 节就是使用整理后的教师样本对已有模型做监督微调的实例。3

量化通常降低数值表示精度,蒸馏则训练学生去学习教师提供的信号;两者还可以组合。4量化不应只凭模型文件变小就被称为蒸馏。如果只是让回答读到最新公司资料,应先看RAG,而非立即开始训练。

成本要把训练前后一起算#

本站建议先固定业务评测,再比较:原始学生、训练后的学生和教师。除了任务成功率,还要观察关键错误、拒答、延迟、输出长度和总调用成本。

生成训练数据、筛选数据、训练和持续回归都需要成本。学生参数更少不代表整个系统一定更便宜;如果任务量很小或需要频繁重新训练,节省的推理费用可能不足以抵消投入。这是工程核算建议,不是论文给出的通用阈值。

动手验证#

教学情境:客服系统要抽取“订单号、问题类型、是否需要人工”。先准备一份独立留出集,包含普通问题、缺失订单号和诱导越权请求;不要让这些样本参与教师生成训练数据或调参。

设计一张对照表,三行分别是教师、原始学生、蒸馏后学生,列为字段正确率、关键错误数、延迟与成本。尚未训练时填“未测”,不要虚构提升数字。

验收标准:先定义能接受的质量损失和严重错误上限,再讨论是否省钱。如果学生只在见过的模板上表现好,应检查覆盖范围与数据泄漏,而不是直接宣布完成能力复制。

检验理解 · 教学情境

你会怎么判断?

团队用大模型生成五千条客服答案,训练一个小模型后宣称完成了能力复制。你会检查什么?

想好后,展开参考答案

先检查教师答案质量、样本是否覆盖真实与困难问题,以及留出评测是否独立。再比较学生训练前后、教师与直接小模型方案的质量、延迟和成本。生成文本用于微调可以构成一种蒸馏,但样本数量和训练完成都不能证明复制了教师的全部能力。

可信来源

依据在哪里,能说明什么

正文中的编号链接对应下列资料。教学案例与操作建议由本站整理,不是原作者的实验结果或普遍保证。

来源 1原始论文Geoffrey Hinton、Oriol Vinyals、Jeff Dean

Distilling the Knowledge in a Neural Network

支持的结论:通过教师的软目标向学生迁移知识的蒸馏思路,以及压缩部署成本的研究动机。

适用边界:经典论文的分类等实验不能直接证明当代大语言模型在任意任务中的蒸馏效果。

资料核验于 2026-09-08返回正文 ↑
来源 2原始论文Yoon Kim、Alexander M. Rush

Sequence-Level Knowledge Distillation

支持的结论:使用教师生成序列训练学生的序列级蒸馏方法,说明蒸馏不限于逐类别软概率。

适用边界:论文主要研究神经机器翻译,不能把其加速倍数直接迁移到其他任务和硬件。

资料核验于 2026-09-08返回正文 ↑
来源 3原始论文DeepSeek-AI

DeepSeek-R1 技术报告,第 2.4 节

支持的结论:用教师整理的样本对已有学生模型进行监督微调,作为语言模型蒸馏的具体实例。

适用边界:引用的是报告 v1 的具体训练方案,评测收益受模型、样本与任务影响,不能视为通用保证。

资料核验于 2026-09-08返回正文 ↑
来源 4官方文档Hugging Face

Transformers Quantization overview

支持的结论:量化通过较低精度表示模型数值,与通过教师监督训练学生的蒸馏有所区别。

适用边界:这里只引用量化的概念边界,不据此承诺特定模型的质量、速度或显存收益。

资料核验于 2026-09-08返回正文 ↑