内容提要
Hugging Face发布Open TTS Leaderboard,以WER、逆实时因子、首段音频时间(TTFA)和说话人相似度四项指标评测超8000个TTS模型。文章主张不将指标加权为单一总分,而应先通过Pareto前沿淘汰被全面支配的模型,再按业务需求设硬门槛。各指标均有局限,部署指标与流式打断体验也需纳入验收,建议团队复用评测协议而非照抄排名。
延伸解读
为什么不能把TTS指标压成一个总分
文章指出,若将词错误率、首段延迟、模型大小和相似度直接加权,权重稍改冠军就会换。更稳妥的做法是先找Pareto前沿,淘汰在所有指标上都不占优的模型,再按业务设硬门槛。这能避免因主观权重而误选,保留各有优势的候选。
四个指标各自的盲区
词错误率低可能只代表发音清楚,不保证停顿自然;逆实时因子高只说明批量生成快,不回答用户多久听到第一声;首段音频时间短可能靠极小分片换来卡顿;说话人相似度高只表示嵌入空间接近,不能证明情绪、年龄感被保留。选型时需结合业务补测。
部署与流式打断的验收要点
模型大小不等于运行显存,量化、声码器、缓存与并发都会改变峰值,同一模型在不同硬件上排序可能不同。验收应拆分冷启动、预热后单请求、稳定并发和长文本。若支持流式打断,还需检查停止后是否继续占用算力,以及播放器缓冲区是否播完已停止的声音。
复用评测协议而非照抄排名
文章建议团队复用榜单的评测协议:同硬件、同提示集、固定预热、报告中位数,并按语言分别看结果。官方结果基于特定H200、CPU、默认声音和50条英文提示,不能直接代表你的并发、文本长度与中文领域词。任何总分第一都应能还原到原始指标。
Q&A
Open TTS Leaderboard 是什么?它评测了哪些指标?
Hugging Face 于9月30日发布的 Open TTS Leaderboard,用于规模化比较开源 TTS 模型。它使用四项客观指标:词错误率(WER)或字错误率、逆实时因子(衡量离线吞吐)、首段音频时间(TTFA,衡量流式交互延迟)和基于 WavLM 说话人嵌入的余弦相似度(评估克隆声音与参考音频的接近程度)。
为什么不能把 WER、TTFA、SIM 等指标加权成一个总分来选 TTS 模型?
因为权重稍改,冠军就会换。更稳妥的方法是先找 Pareto 前沿:若模型 A 在所有指标上都不比 B 差且至少一项更好,则 B 被 A 支配,应淘汰。留下的模型没有全面更差的输家,再按真实业务设硬门槛筛选。
如何用 Pareto 前沿筛选 TTS 模型?能给出一个简单示例吗?
用四项指标(WER、TTFA、SIM、模型大小)比较,越小越好的指标取小,越大越好的取大。若模型 A 在所有指标上不差于 B 且至少一项更好,则 B 被支配淘汰。例如假数据中模型 C 被 A 在四项上同时支配,因此淘汰;A、B、D 各有优势,保留为前沿。
WER、逆实时因子、TTFA 和说话人相似度这四个指标分别有什么局限?
WER 低可能只是发音清楚,不代表停顿自然;对中文应看字符错误率,并单列数字、日期和中英混读。逆实时因子高说明批量生成快,但不能回答用户多久能听到第一声。TTFA 短可能靠极小分片换来频繁调度和播放卡顿,需测后续分片间隔。说话人相似度高只表示嵌入空间接近,不能证明情绪、年龄感或音色细节被忠实保留。
部署 TTS 模型时,除了榜单指标,还需要关注哪些实际因素?
模型大小不等于运行显存,量化、声码器、缓存与并发都会改变峰值;同一模型在 H200、消费级 GPU 和 CPU 上的排序可能不同。实际验收应把“模型加载后首请求”“预热后单请求”“稳定并发”和“长文本”拆开报告。若支持流式打断,还需检查停止请求后模型是否继续占用算力,以及播放器缓冲区是否会继续播放已停止的声音。
团队应该如何正确使用 Open TTS Leaderboard 的排名结果?
不应照抄榜单排序,而应复用它的评测协议:同硬件、同提示集、固定预热、报告中位数,并按语言分别看结果。官方结果使用特定 H200、CPU、默认声音和 50 条英文提示,不能直接代表你的并发、文本长度与中文领域词。建议先通过 Pareto 前沿淘汰被全面支配的模型,再按业务需求设硬门槛,最后进行随机化盲听。