论文解读|WavAlign:让语音模型既会“想”,也会“说”

论文解读|WavAlign:让语音模型既会“想”,也会“说”

💡 原文中文,约3900字,阅读约需10分钟。
📝

内容提要

端到端语音对话模型最让人头疼的地方,是“聪明”和“会说”常常互相拉扯。WavAlign 给出的答案很朴素:不要把同一个偏好奖励粗暴地砸到所有 token 上。把语义交给偏...

➡️

继续阅读