← 返回资讯
研究 HuggingFace Daily Papers

OmniVAE:跨模态对齐的音视频 VAE 实现联合生成

现有音视频联合生成方法分别训练 VAE,导致潜在空间缺乏跨模态对齐,使下游生成模型需从头学习跨模态同步。OmniVAE 提出一种联合训练的音视频 VAE,实现跨模态对齐。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。