内容提要
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文字模型,价格不变、准确率翻倍,专攻嘈杂电话、多人对话、口音等难处理音频。支持批量与实时流式,具备时间戳、说话人分离、多语言切换等功能。批量价格为每音频小时 0.10 美元,流式为 0.20 美元。Atlassian Loom 已采用该模型转写视频。
延伸解读
基准测试的解读与局限
SpaceXAI 宣称 Grok Voice Transcribe 2.0 在 Artificial Analysis 的 AA-WER Streaming 榜单上位列 32 个流式模型之首,该基准使用约 8 小时音频,权重为 AA-AgentTalk 50%、VoxPopuli 25%、Earnings22 25%。但内部四个数据集(电话、对话、凭证、短句)的 WER 结果均为厂商自行报告,未经独立复现。读者需注意,这些数据可能无法完全反映实际应用中的表现,尤其是面对未覆盖的音频类型或口音时。
定价与成本效益
Grok Voice Transcribe 2.0 的定价与 1.0 版本相同:批量转写每音频小时 0.10 美元,流式为 0.20 美元,约合每 1000 分钟 1.67 美元和 3.33 美元。说话人分离、时间戳和关键术语偏置均不额外收费。对于需要处理大量音频的企业,这一价格可能具有竞争力,但需考虑实际使用中流式与批量的比例,以及是否会产生其他 API 调用费用。
功能特性与适用场景
该模型支持批量与实时流式转写,提供词级时间戳、说话人分离、多通道转写(最多 8 通道)、关键术语偏置(每次最多 100 个术语)和文本格式化。填充词默认移除,并具备智能轮次检测。这些功能使其适合客服电话分析、会议记录、视频转写等场景。但需注意,模型仅以托管 API 形式提供,未开放权重,因此无法自托管,且需显式设置 model=grok-voice-transcribe-2.0。
实际应用案例:Atlassian Loom
Atlassian Loom 已采用 Grok Voice Transcribe 2.0 转写所有视频,并认为其比现有方案更准确。其工作流为“录制、转写、然后编码”:用户录制行动方案,转写文本送入 Cursor 完成代码更新。这一案例展示了语音转文本在开发协作中的潜在价值,但具体效果可能依赖于音频质量和领域术语的覆盖程度。
Q&A
Grok Voice Transcribe 2.0 是什么?它主要解决什么场景的语音转写问题?
Grok Voice Transcribe 2.0 是 SpaceXAI 发布的最新语音转文字(STT)模型,构建于 Grok Voice 背后的音频基础模型之上。它专攻“难啃”的音频,包括嘈杂的电话线路、多人同时说话、地方口音以及口头报出的凭证信息,通过 Speech to Text API 同时支持批量与实时流式两种模式。
Grok Voice Transcribe 2.0 的定价是多少?批量与流式价格有何区别?
定价与 1.0 版本完全一致:批量转写为每音频小时 0.10 美元,流式为每小时 0.20 美元。说话人分离、时间戳和关键术语均包含在内,换算下来约为每 1000 分钟 1.67 美元和 3.33 美元。
Grok Voice Transcribe 2.0 在准确率方面有哪些提升?有具体数据吗?
SpaceXAI 称其在价格不变的前提下,准确率是 1.0 的两倍。在公开的 Artificial Analysis 榜单上,该模型在 32 个流式模型中位列准确率第一(AA-WER Streaming 基准)。在 19 种语言的短句数据集上,WER 从 20.6% 降至 6.8%,词错误减少约 67%。这些内部结果由厂商自行报告,未经独立复现。
Grok Voice Transcribe 2.0 支持哪些开发者功能?
它在一个 API 中提供多项功能:批量与流式转写(文件/URL 或通过 WebSocket 在 wss://api.x.ai/v1/stt 流式传输);词级时间戳(含开始、结束时间与置信度分数);说话人分离(不额外收费);多通道转写(最多 8 个通道);关键术语偏置(每次请求最多 100 个术语,每个最长 50 字符);文本格式化(数字、日期、货币、电话号码和邮箱以书面形式返回);填充词移除(默认移除“um”和“uh”);智能轮次检测。批量端点支持最大 500 MB 文件、涵盖 12 种音频格式,流式模式还支持 Opus。
Grok Voice Transcribe 2.0 在多语言和语言切换方面表现如何?
该模型可转写数十种语言,并自动检测语种,还能在单次处理中跟随录音中途的语言切换。SpaceXAI 团队称多语言准确率是相比 1.0 提升最大的一项。文档列出了 25 种语言支持数字、货币和单位的书面形式格式化。
Grok Voice Transcribe 2.0 可以自托管部署吗?如何调用?
不可以自托管。它仅以托管 API 的形式提供,SpaceXAI 尚未公布开放权重。模型 ID 为 grok-voice-transcribe-2.0,调用时需显式设置 model=grok-voice-transcribe-2.0。
有哪些实际应用案例使用了 Grok Voice Transcribe 2.0?
Atlassian Loom 现已使用 Grok Voice Transcribe 2.0 转写每一个视频,并发现它比现有方案更准确。其工作流是“录制、转写、然后编码”:用户在 Loom 中录下行动方案,转写文本被送入 Cursor,由 Cursor 完成代码更新。Atlassian 团队协作产品集高级副总裁 Sanchan Saxena 将其描述为“从上下文到代码的闭环”。