LLaDA MoE v2:专家混合扩散语言模型的规模化研究
系统研究了专家混合扩散语言模型的规模化行为,发现其优化超参数缩放规律与自回归模型存在显著差异:最优批次大小增长更快,最优学习率衰减更快,且等计算量分析显示模型-数据分配策略也有所不同。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
系统研究了专家混合扩散语言模型的规模化行为,发现其优化超参数缩放规律与自回归模型存在显著差异:最优批次大小增长更快,最优学习率衰减更快,且等计算量分析显示模型-数据分配策略也有所不同。
查看原文