这是 Hinton 原始论文提出的经典方法,学生模型直接模仿教师模型最终输出层的概率分布。实现简单、收敛快速,适用于大多数分类任务。该方法只需访问教师的 logits 输出,不关心中间层特征,因此对教师和学生模型的架构差异容忍度较高。
FitNets 等方法将知识传递从输出层延伸到中间层,学生模型学习匹配教师模型隐藏层的特征表示。具体做法是通过可学习的投影层对齐教师与学生中间特征图的维度,然后最小化两者之间的 L2 距离或余弦相似度。这种方法能够传递更丰富的语义和层次化信息,特别适合计算机视觉等需要空间感知能力的任务。
RKD(Relational Knowledge Distillation)等方法不直接匹配输出或特征,而是关注教师模型捕捉到的数据结构关系——如不同样本之间的相对距离、角度关系或层间依赖。学生模型被要求保持与教师相同的结构化知识,从而继承更深层次的推理模式。这种方法在多模态和跨域任务中展现出独特优势。
针对 Transformer 架构的大语言模型,注意力蒸馏专门传递教师模型的注意力模式。学生模型学习教师在生成每个 token 时关注哪些上下文位置,从而保留推理模式和语境理解能力。这对于需要长程依赖建模的任务尤为重要。