与传统离线蒸馏需要一个预先训练好的静态教师模型不同,在线知识蒸馏(Online Knowledge Distillation)中多个学生模型同时从零开始训练,彼此互为师生。这消除了预训练教师模型的高昂计算开销,降低了蒸馏的入门门槛。
在线蒸馏中的"教师"信号是动态变化的——随着训练的推进,同伴模型的能力不断提升,提供的知识质量也随之改善。这种协同进化机制使得学生模型能够在训练过程中持续获得越来越强的监督信号,往往能实现比静态教师更快的收敛速度。
深度互学习(Deep Mutual Learning)是在线蒸馏的代表性方法,一组学生模型并行训练,每个模型既从真实标签学习,也从同伴模型的软预测中学习。其他变体包括虚拟集成教师(通过特征融合或注意力加权聚合多个同伴的输出)、自蒸馏(同一模型的早期 checkpoint 作为后期版本的教师)等。2026 年的最新研究进一步将在线蒸馏扩展到自回归语言模型,通过教师网络集成在线模块与学生同步训练,实现了训练时间的大幅缩减。