清华大学团队研究发现,在线蒸馏中仅用一条训练query即可覆盖全量数据71.5%的学生状态,恢复大部分收益。瓶颈不在数据供给,而在算法吸收效率。多教师设定下,16条语义多样的query即可追平全量训练。建议优化算法侧训练动力学,而非堆数据。
本文介绍了知识蒸馏的三种主要类型:基于响应、特征和关系的知识蒸馏,涵盖了离线、在线和自知识蒸馏的研究。总结了各类方法的核心思想及其在图像识别中的应用,探讨了多教师、跨模态和对抗知识蒸馏等扩展技术,并展望了未来发展方向。
完成下面两步后,将自动完成登录并继续当前操作。