多轮长时域规划:从预训练到后训练的同策略智能体蒸馏
多轮长时域规划对基础模型智能体至关重要,但现有模型训练数据不可控、不透明,难以理解规划能力如何获得和整合。研究提出了统一可控的多轮环境,系统研究长时域规划在预训练等阶段的获取机制,通过单/多教师同策略蒸馏提升规划能力。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
多轮长时域规划对基础模型智能体至关重要,但现有模型训练数据不可控、不透明,难以理解规划能力如何获得和整合。研究提出了统一可控的多轮环境,系统研究长时域规划在预训练等阶段的获取机制,通过单/多教师同策略蒸馏提升规划能力。
查看原文