SlimSearcher:基于自适应奖励门控的高效Web代理训练
SlimSearcher是一个通过帕累托高效轨迹过滤和自适应奖励塑造来提升深度研究代理效率的框架,在保持准确性的同时降低计算成本。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
SlimSearcher是一个通过帕累托高效轨迹过滤和自适应奖励塑造来提升深度研究代理效率的框架,在保持准确性的同时降低计算成本。
查看原文