ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频创作
近期视频模型日益在同一模型中支持生成、参考条件控制和编辑,但通常将其作为对固定输入的独立操作暴露。实际创作跨越多镜头,要求模型在保持共享历史的同时从文本生成、遵循参考或编辑源素材。我们将此设定形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster,一个具有角色感知上下文表示的统一模型。交互式模型必须保留对扩展历史的访问...
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
近期视频模型日益在同一模型中支持生成、参考条件控制和编辑,但通常将其作为对固定输入的独立操作暴露。实际创作跨越多镜头,要求模型在保持共享历史的同时从文本生成、遵循参考或编辑源素材。我们将此设定形式化为交互式多镜头视频创作(IMVC),并引入ContextMaster,一个具有角色感知上下文表示的统一模型。交互式模型必须保留对扩展历史的访问...
查看原文