首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >知识蒸馏 >基于响应的知识蒸馏和基于特征的知识蒸馏有什么区别?

基于响应的知识蒸馏和基于特征的知识蒸馏有什么区别?

词条归属:知识蒸馏

1. 知识传递的位置不同

基于响应的方法仅在网络的最终输出层进行知识传递,学生模型只需要让最终预测分布接近教师即可。基于特征的方法则在网络的多个中间层建立对齐关系,要求学生模型在特征提取的各个阶段都模仿教师的行为。后者传递的知识更加细粒度和多层次。

2. 架构兼容性不同

响应式蒸馏对教师和学生模型的架构差异几乎没有限制,因为只比较最终的 logits 向量,维度相同即可。特征式蒸馏则要求教师和学生存在可对齐的中间层结构,当两者架构差异较大时需要设计额外的适配层(如 1×1 卷积或线性投影)来桥接维度不匹配的问题。

3. 适用场景不同

响应式蒸馏因实现简单、计算开销小,适合实时部署场景和资源受限的边缘设备。特征式蒸馏由于传递了更丰富的中间表征信息,在细粒度分类、目标检测、语义分割等需要空间或谱信息的复杂任务中表现更优。实际工程中,两者也常被组合使用以获得最佳效果。

相关文章
[IJCAI 2022 | 论文简读] 基于知识蒸馏的持续联邦学习
Continual Federated Learning Based on Knowledge Distillation
智能生信
2022-12-29
1.5K0
基于知识蒸馏的BERT模型压缩
在过去一年里,语言模型的研究有了许多突破性的进展, 比如GPT用来生成的句子足够以假乱真[1];BERT, XLNet, RoBERTa [2,3,4]等等作为特征提取器更是横扫各大NLP榜单。但是,这些模型的参数量也相当惊人,比如BERT-base有一亿零九百万参数,BERT-large的参数量则高达三亿三千万,从而导致模型的运行速度过慢。为了提高模型的运行时间,本文率先提出了一种新的知识蒸馏 (Knowledge Distillation) [5] 方法来对模型进行压缩,从而在不损失太多精度的情况下,节省运行时间和内存。文章发表在EMNLP 2019。
大数据文摘
2019-10-16
1.2K0
基于GAN的无数据知识蒸馏
最近在做知识蒸馏的时候了解到了一些无数据蒸馏算法,在无法获取到原始训练数据(机密数据、隐私数据、数据集太大或者是没有百度云会员下不动数据)的情况下,可以尝试一下这种类型的蒸馏算法,也许有奇效呢。
带萝卜
2020-10-26
1.6K0
独家 | 基于知识蒸馏的BERT模型压缩
在过去一年里,语言模型的研究有了许多突破性的进展, 比如GPT用来生成的句子足够以假乱真[1];BERT, XLNet, RoBERTa [2,3,4]等等作为特征提取器更是横扫各大NLP榜单。但是,这些模型的参数量也相当惊人,比如BERT-base有一亿零九百万参数,BERT-large的参数量则高达三亿三千万,从而导致模型的运行速度过慢。为了提高模型的运行时间,本文率先提出了一种新的知识蒸馏 (Knowledge Distillation) [5] 方法来对模型进行压缩,从而在不损失太多精度的情况下,节省运行时间和内存。文章发表在EMNLP 2019。
数据派THU
2019-10-14
1.2K0
CVPR 2020 | 基于知识蒸馏的分块监督NAS
以机器自动设计网络结构为目标的神经网络搜索(NAS,Neural Architecture Search)有望为机器学习带来一场新的革命。
CV君
2020-03-21
1.5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券