知识蒸馏的总训练成本包含两部分:教师模型的推理成本和学生模型的训练成本。教师推理属于前向传播,计算量约为 2 × N_teacher × D_distill FLOPs;学生训练的反向传播约为 6 × N_student × D_distill FLOPs。相比之下,从头训练一个同等规模的学生模型需要 6 × N_student × D_full FLOPs,且需要更大规模的全量训练数据。当蒸馏数据集规模可控时,蒸馏的总成本通常低于从头训练。
大量实证研究表明,通过知识蒸馏训练的学生模型在几乎所有基准任务上都显著优于直接训练的同规模模型。这是因为蒸馏为学生提供了更丰富的监督信号——教师模型的软标签包含了类别关系、不确定性等高阶信息,这些信息是硬标签无法提供的。特别是在推理能力迁移方面,蒸馏模型的表现远超直接训练的小模型,DeepSeek-R1 蒸馏版在数学推理上甚至超越了两倍参数的直接训练模型。
知识蒸馏对小规模训练数据更加友好。由于软标签提供了更强的监督信号,学生模型在较少训练样本下就能达到较好的性能水平。这一特性在垂直领域应用中尤其有价值——当领域标注数据稀缺时,利用通用大模型作为教师进行蒸馏,可以用较少的领域数据训练出高质量的专用小模型。