硬标签仅提供"唯一正确答案"的二元信号,丢失了所有关于错误类别的信息。软标签则保留了教师模型对每个类别的置信度分布,包含类别间的相似性结构和不确定性建模信息。例如在图像分类中,软标签能揭示"猫"与"狗"的视觉相似性远高于"猫"与"汽车",这种类间关系对提升学生模型的泛化能力至关重要。
使用硬标签训练时,梯度仅在正确类别方向上有非零值,学习信号稀疏。而软标签在所有类别上都提供梯度信号,使学生模型能够从每一个训练样本中获得更丰富的监督信息。这在训练数据有限的场景下尤为有价值,相当于用同样的数据量获得了更强的学习效果。
软标签具有正则化效应。由于教师模型的概率分布比硬标签更加平滑,学生模型不容易对训练数据中的噪声或异常样本过度拟合。这种隐式的正则化机制使得蒸馏后的学生模型在测试集上往往表现出更好的泛化性能。