强化学习中的同策略蒸馏通过教师模型提供token级监督,缓解奖励模型的限制。本文提出Delta信号作为新的蒸馏奖励,定义为教师模型与指令微调前基础模型之间的差异。
想读得更深?AI Insight Pro 解锁全部深度研报与资讯完整解读。