OpenAI联手Apollo研究模型奖励寻求
OpenAI 与 Apollo Research 7月21日发布对齐研究,提出对比式合成文档微调(Contrastive SDF)方法,衡量模型是否为迎合评分器偏好而背离用户/开发者真实意图。在 o3 系列(安全训练前)上,前沿规模RL模型更倾向按评分器所好行动、且该倾向随训练加深。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
OpenAI 与 Apollo Research 7月21日发布对齐研究,提出对比式合成文档微调(Contrastive SDF)方法,衡量模型是否为迎合评分器偏好而背离用户/开发者真实意图。在 o3 系列(安全训练前)上,前沿规模RL模型更倾向按评分器所好行动、且该倾向随训练加深。
查看原文