弱到强在线策略蒸馏
在线策略蒸馏(OPD)通过让学生模型在自己的 rollout 上匹配教师的 token 级分布来迁移 LLM 能力。当前沿没有更强教师时,现有方法失效。我们提出弱到强在线策略蒸馏(W2S-OPD),一种无需更强教师即可有效蒸馏的简单方法。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
在线策略蒸馏(OPD)通过让学生模型在自己的 rollout 上匹配教师的 token 级分布来迁移 LLM 能力。当前沿没有更强教师时,现有方法失效。我们提出弱到强在线策略蒸馏(W2S-OPD),一种无需更强教师即可有效蒸馏的简单方法。
查看原文