本文探讨了连续扩散口语语言模型(CD SLM)的可行性,指出其在性能上优于离散自回归模型。通过音素詹森-香农散度(pJSD)指标的引入,分析显示CD SLM在验证损失和pJSD上遵循缩放规律。尽管其生成多语种情感语音的能力增强,实现长篇连贯性仍面临挑战。
本研究提出了SpeechSSM模型,解决了现有口语语言模型在生成长篇语音时的连贯性问题。该模型能够在单次解码中学习并生成长篇语音,显著提升了长篇语音处理能力,并引入了新的评估指标和基准。
完成下面两步后,将自动完成登录并继续当前操作。