← 返回资讯
大模型 HuggingFace Daily Papers

KVAE:多模态生成模型的分词器系列

隐扩散模型依赖分词器将输入信号映射为压缩表示,分词器直接影响学习速度、合成质量并为后续应用奠定基础。本报告提出了KVAE系列分词器,包括KVAE-Audio(48kHz全频段连续分词器,64通道)和KVAE-3D(两种因果视频分词器)等。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。