知识蒸馏并不总是遵循"教师越强、学生越好"的逻辑。当教师模型与学生模型之间存在显著的规模差距时,会出现"容量鸿沟"现象——过于强大的教师反而无法有效指导小型学生模型。其根本原因在于,预训练过程中教师模型对正确类别的置信度不断攀升,非目标类别的概率被极度压缩,导致概率分布的形状超出了学生模型有限的表征能力范围。南京大学 2025 年的研究指出,强教师倾向于在非目标类别上产生过于平坦的概率分布,抹除了细粒度的语义亲和性信息。解决思路包括引入中间尺寸的"导师助理"(Teacher Assistant)作为桥梁、采用迭代式蒸馏逐步缩小规模差距,或通过增强非目标类别间的区分度来缓解负面影响。
知识蒸馏涉及多个关键超参数——温度系数 T、损失权重 α、学习率调度等,这些参数的组合对最终效果影响显著。温度过高会导致学生过度拟合教师的噪声输出,温度过低则无法充分提取暗知识。在线蒸馏场景下还需额外处理训练不稳定问题,因为教师和学生模型同时更新可能引发振荡。工程实践中通常需要通过系统的网格搜索或贝叶斯优化来确定最优参数组合,这增加了调参成本。
蒸馏过程会将教师模型的偏见和错误一并传递给学生模型。如果教师模型在某些类别或场景上存在系统性偏差,学生模型会继承甚至放大这些偏差。此外,蒸馏出的学生模型通常在特定任务上表现优异,但泛化能力可能不如教师模型——当部署环境的数据分布与蒸馏训练数据存在偏移时,学生模型的性能下降幅度往往大于教师模型。这要求在蒸馏数据的选择上尽可能覆盖多样化的场景分布。
尽管蒸馏的最终目标是降低部署成本,但蒸馏过程本身需要同时维护教师和学生两个模型,训练期间的显存占用和计算开销显著高于单独训练一个小模型。对于超大尺度教师模型(如千亿参数级别),即使采用冻结参数的方式,其推理开销仍然可观。此外,特征式蒸馏需要在教师和学生之间建立中间层映射关系,当两者架构差异较大时,适配层的设计和调优增加了工程实现的复杂度。