← 返回资讯
研究 HuggingFace Daily Papers 2026-07-20

同策略Delta蒸馏方法

同策略Delta蒸馏方法

强化学习中的同策略蒸馏通过教师模型提供token级监督,缓解奖励模型的限制。本文提出Delta信号作为新的蒸馏奖励,定义为教师模型与指令微调前基础模型之间的差异。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。