本文提出了分层量化变分自动编码器(HQ-VAE)和鲁棒生成模型(RVQ-VAE),有效解决了分层 VQ-VAE 的层级坍塌问题,提升了重建性能。通过动态量化和在线聚类学习,改进了图像生成质量,并在视觉和语音任务中展示了其优势。
T2M-HiFiGPT是一种新型条件生成框架,能够生成人体动作。它基于RVQ-VAE和双层GPT结构,研究表明RVQ-VAE能够产生高精度的2D时间-残差离散动作表示。双层GPT结构能够将先前帧和文本描述的信息压缩成1D上下文向量,并通过RVQ-VAE解码器将生成的残差离散指标转化回动作数据。该框架在HumanML3D和KIT-ML数据集上表现出色,优于最新的基于扩散和GPT的方法。
完成下面两步后,将自动完成登录并继续当前操作。