B站发布IndexTTS 2.5语音合成模型,支持中英日西阿五语种零样本配音,推理速度提升2.28倍,并增强跨语言情绪还原与语速控制。团队通过降低语义帧率、换用Zipformer架构及GRPO强化学习优化性能,在情感迁移和说话人相似度上表现优异,旨在让创作者用任意声音、语言和情绪进行配音。
完成下面两步后,将自动完成登录并继续当前操作。