WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。
完成下面两步后,将自动完成登录并继续当前操作。