Flux-OPD:随学生表现演化的上下文的首要策略蒸馏
大语言模型在开放式领域训练中缺乏可验证奖励,任务偏好难以形式化为有效监督。上下文虽能传达偏好,但蒸馏到学生模型后额外监督有限,需随学生表现演化的上下文。然而直接使用演化上下文会导致蒸馏目标不稳定和分布冲突。本文通过分解分析上下文的效果。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
大语言模型在开放式领域训练中缺乏可验证奖励,任务偏好难以形式化为有效监督。上下文虽能传达偏好,但蒸馏到学生模型后额外监督有限,需随学生表现演化的上下文。然而直接使用演化上下文会导致蒸馏目标不稳定和分布冲突。本文通过分解分析上下文的效果。
查看原文