论文解读|WavAlign:让语音模型既会“想”,也会“说”

论文解读|WavAlign:让语音模型既会“想”,也会“说”

💡 原文中文,约3900字,阅读约需10分钟。
📝

内容提要

WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。

🔎

延伸解读

为什么统一RL目标会失败?

论文指出,端到端语音模型在偏好优化时,奖励是稀疏的序列级信号,而语音token密集且梯度能量弱,导致共享参数更新时互相干扰。具体表现为跨模态权衡、梯度能量不均衡、稀疏奖励被稀释,最终造成语音自然度下降。这解释了为何简单地将RL应用于所有token效果不佳。

动态权重如何平衡语义与语音?

WavAlign通过动态门控机制调节SFT和GRPO的混合比例。只有当rollout中至少有一个样本超过质量阈值且候选间奖励方差足够大时,才提高GRPO权重;否则更多依赖SFT。同时设置λmax=0.8,保留至少20%的SFT作为语音安全锚点,并用EMA平滑权重,确保训练稳定。

消融实验揭示的关键因素

消融实验显示,仅动态权重但优化范围覆盖所有token时,IQ/EQ仅为48.84/2.50;将范围限制到文本token后,固定权重已提升至52.60/2.60;再加入动态权重和EMA,达到55.24/2.92。这说明优化范围比强度更重要,动态权重进一步增益。

Q&A

WavAlign 的核心思想是什么?

WavAlign 的核心思想是:在端到端语音对话模型的后训练中,不要将同一个偏好奖励应用到所有 token 上,而是将偏好优化(GRPO)仅用于文本 token,语音 token 保留 SFT 监督,并通过动态权重根据 rollout 质量调节两者比例,从而减少 acoustic drift,同时提升语义能力和表达力。

WavAlign 主要解决什么问题?

WavAlign 主要解决端到端语音对话模型在偏好优化时,由于奖励是稀疏的序列级信号而语音生成是密集的长 token 序列,导致将同一奖励硬分给文本和语音时,出现语义可能变好但音色、韵律、自然度漂移的问题。

WavAlign 如何实现语义和语音的优化分工?

WavAlign 将训练目标拆分:SFT 负责所有 token(文本和语音),确保语音分布自然;偏好优化(GRPO)只作用于文本 token,避免不可靠的声学奖励影响语音;同时通过动态权重 λ 根据 rollout 质量调节两者比例,λ 由 reward 最大值和方差控制,并用 EMA 平滑。

WavAlign 的动态权重 λ 是如何调节的?

动态权重 λ 通过两个信号控制:一是 rollout 中是否至少有一个样本超过可接受质量阈值,二是候选样本的 reward 方差是否足够大。只有当候选有明显好坏差异时,才提高偏好优化的权重;否则更多依赖 SFT。论文设置 λmax=0.8,并采用 EMA(α=0.9)平滑权重抖动。

WavAlign 在哪些模型上进行了验证?结果如何?

WavAlign 在 VITA-Audio(interleaved 架构)和 KimiAudio(parallel 架构)上验证。实验表明,该方法在 IQ(语义能力)和 EQ(表达力)上均优于统一 RL 目标,在 VoiceBench/OpenAudioBench 和 VStyle 等基准上取得最佳或接近最佳的综合表现。

WavAlign 的消融实验得出了什么关键结论?

消融实验表明:只做动态权重不够,如果优化范围仍是 all tokens,IQ/EQ 只有 48.84/2.50;将范围限制到 text tokens 后,固定 0.5/0.5 提高到 52.60/2.60;最终加入动态权重和 EMA,达到 55.24/2.92。结论是优化范围比优化强度更重要,动态 gate 是稳定器。

WavAlign 对多模态后训练有什么启示?

WavAlign 的启示是:在复杂模态混合场景下,不要假设同一个序列级奖励能同等指导所有 token。应先判断奖励在哪个模态上更可信,再决定梯度作用在哪里,往往比简单扩大 RL 规模更有效。

🏷️

标签

➡️

继续阅读