本研究提出了一系列基于音频驱动的说话人脸生成方法,包括高保真NeRF技术、统一面部标记生成器和两阶段生成模型,旨在提高口型同步和视觉质量。通过自我监督学习和新颖的扩散模型,解决了现有模型在唇形同步和视觉细节保留方面的不足,实验结果显示性能优于现有技术。
完成下面两步后,将自动完成登录并继续当前操作。