内容提要
Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞品。模型采用自适应延迟机制,通过强化学习平衡准确性与速度。API定价每小时0.18美元,但不开放权重。Meta因眼镜和Mac应用等产品需求,持续推动该技术发展。
延伸解读
自适应延迟机制的意义
Muse Voice Transcribe通过自适应延迟机制,在准确性和速度之间做出权衡。模型每80毫秒接收音频块,并决定是立即输出文本还是等待更多上下文。这种设计让简单词汇快速转录,复杂词汇则延迟以获取更多信息,从而在整体上平衡了词错误率和延迟。这一机制通过强化学习优化,将词错误率奖励和延迟奖励相乘,而非简单相加,体现了模型在实时转录中对资源分配的精细控制。
基准测试的局限性
虽然Muse Voice Transcribe在AA-WER Streaming基准上以3.1%的词错误率领先,但该基准仅针对英语语音。对于多语言和说话人区分,模型的表现可能不同。此外,说话人识别错误率仍高达17.5%,表明该技术尚未成熟。因此,基准测试的领先优势可能无法全面反映模型在真实场景中的表现,尤其是在非英语环境或复杂对话中。
API定价与开放策略
Muse Voice Transcribe的API定价为每小时0.18美元,相对合理,但Meta决定不开放模型权重,这与Muse Glimmer系列形成对比。这一策略可能旨在保护商业利益,但也限制了开发者和研究者的定制能力。对于依赖开源模型的企业,这可能是一个考虑因素。不过,Meta通过API提供访问,仍能吸引用户使用其服务。
Q&A
Meta新发布的实时语音识别模型叫什么?
Meta发布的实时语音识别模型名为Muse Voice Transcribe。
Muse Voice Transcribe支持哪些语言和功能?
Muse Voice Transcribe支持70多种语言,其中25种经过广泛验证,能区分20多位说话者,并支持超过一小时的长时间对话。
Muse Voice Transcribe在基准测试中的表现如何?
在Artificial Analysis的AA-WER Streaming基准测试中,Muse Voice Transcribe的词错误率为3.1%,优于Cartesia Ink-2(3.4%)、ElevenLabs Scribe v2 Real-time(3.6%)、GPT Live Transcribe(3.9%)和Gemini 3.5 Transcribe Live(4%)。在说话者识别方面,其错误率为17.5%,也领先于其他实时模型。
Muse Voice Transcribe的API定价是多少?
Muse Voice Transcribe的API定价为每1000音频分钟3美元,即每小时0.18美元。
Muse Voice Transcribe的权重是否开放?
不,Meta不会开放Muse Voice Transcribe的权重,这与Muse Glimmer模型不同。
Muse Voice Transcribe如何实现自适应延迟?
Muse Voice Transcribe将音频按80毫秒的块处理,每个块压缩为一个软令牌。模型在每个块决定是输出文本令牌还是“下一个音频”占位符。通过控制听到的音频量,模型可以调整延迟:困难词汇获得更多上下文,简单词汇几乎立即转录。这种权衡通过强化学习训练,将词错误率奖励和延迟奖励相乘。
Meta为什么持续推动实时转录技术?
Meta的眼镜和Mac应用等核心产品都需要实时转录功能,因此有内在动力持续改进该技术。