教师模型的性能应比学生模型的目标性能高出至少 5% 以上,以确保有足够的"知识盈余"可供迁移。但教师并非越大越好——过大的教师模型会显著增加蒸馏过程中的推理开销和显存占用。工程实践中,教师模型的推理耗时不宜超过学生模型的 3 倍。值得注意的是,2026 年的研究发现轻量级教师模型(如 DeepSeek-V4 Flash 版本)有时反而能教出更强的学生,因为其输出更凝练、熵值更低,减少了冗余响应对蒸馏目标的干扰。
虽然响应式蒸馏对架构差异容忍度高,但教师与学生模型在基础架构类型上的相似性仍会影响蒸馏效果。卷积神经网络更适合蒸馏到卷积学生,Transformer 架构更适合 NLP 任务的蒸馏。当需要进行跨架构蒸馏时(如 Transformer 教师蒸馏到 CNN 学生),通常需要引入额外的适配层来桥接表征空间的差异。
2026 年的前沿实践表明,教师不需要在所有维度上都更强,只要在特定上下文中更专业即可。为不同领域分别训练专门的教师模型,然后通过多教师蒸馏融合到一个学生中,往往比使用单一全能型大教师效果更好。这种"多专家教一学生"的范式已成为当前主流实验室的标准做法。