← 返回资讯
研究 HuggingFace Daily Papers

ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频创作

近期视频模型日益在同一模型中支持生成、参考条件控制和编辑,但通常将其作为对固定输入的独立操作暴露。实际创作跨越多镜头,要求模型在保持共享历史的同时从文本生成、遵循参考或编辑源素材。我们将此设定形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster,一个具有角色感知上下文表示的统一模型。交互式模型必须保留对扩展历史的访问...

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。