LLM 高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失
小型语言模型在严格的延迟、成本和本地部署约束下往往是唯一选择,通常通过知识蒸馏从压缩模型恢复。蒸馏训练对最终质量至关重要但成本高昂。本研究围绕两个系统贡献探讨如何提升蒸馏效率:首先证明离线 KD(缓存教师 top-K logits 一次并针对缓存训练学生)可接近在线蒸馏效果。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
小型语言模型在严格的延迟、成本和本地部署约束下往往是唯一选择,通常通过知识蒸馏从压缩模型恢复。蒸馏训练对最终质量至关重要但成本高昂。本研究围绕两个系统贡献探讨如何提升蒸馏效率:首先证明离线 KD(缓存教师 top-K logits 一次并针对缓存训练学生)可接近在线蒸馏效果。
查看原文