Wispr Flow 融资 2.8 亿美元并推出语音 AI 模型

Wispr Flow 融资 2.8 亿美元并推出语音 AI 模型

💡 原文中文,约1300字,阅读约需4分钟。
📝

内容提要

Wispr AI完成2.8亿美元B轮融资,估值达20亿美元,并推出自研语音模型Canto。该模型能在嘈杂环境中识别语音,将错误率从30%降至5-10%。其产品Flow已处理超600亿字,被财富500强企业广泛使用,惠及商务人士及听障群体。

🔎

延伸解读

嘈杂环境下的语音识别突破

传统语音模型多在纯净语音上训练,在嘈杂环境中错误率较高。Wispr 的 Canto 模型通过包含噪音、狗吠等干扰的样本训练,能快速分离人声与背景噪音,将嘈杂环境下的错误率从 30% 降至 5-10%。这一进步使得在车内、街道等场景下进行语音输入成为可能,拓展了语音识别的应用边界。

语音输入的应用场景扩展

过去语音识别多用于简单查询,如天气或搜索,因为复杂任务在嘈杂环境下容易出错。Canto 的推出让用户可以在嘈杂环境中口述长文,系统能准确转录并生成文档。这为商务人士、创作者等提供了更高效的输入方式,也推动了语音交互从简单指令向复杂内容创作的转变。

对听障群体的潜在价值

文章指出,聋人和听力障碍人士依赖 AI 转录,但多人对话和嘈杂环境常导致错误。Canto 在嘈杂环境下的低错误率有望改善这一状况,提升转录的准确性。尽管许多人仍依赖设备端转录,但云模式的演进可能为听障群体带来更可靠的实时字幕体验。

Q&A

Wispr Flow 最近完成了多少融资,估值是多少?

Wispr Flow 的开发商 Wispr AI 完成了 2.8 亿美元的 B 轮融资,估值达到 20 亿美元。

Wispr AI 推出的自研语音模型叫什么?它有什么特点?

Wispr AI 推出的自研语音模型叫 Canto。它的特点是能够在嘈杂环境中识别语音,通过将人声与背景噪音分离,降低错误率。

Canto 模型在嘈杂环境下的错误率是多少?

当 Canto 集成到 Flow 中时,嘈杂环境下的错误率从 30% 下降到接近 5% 至 10%。

Flow 的主要功能是什么?

Flow 是一款文本转语音工具,可以集成到各种应用中,让用户对着文本框说话,它能识别口语,修正语法错误、口误、语气词和口吃,生成清晰的文本。

Flow 的用户规模和使用情况如何?

Flow 已处理超过 600 亿字,被几乎所有财富 500 强企业和超过 1 万家企业使用。

Wispr Flow 对哪些人群有帮助?

Flow 对商务人士、NBA 球员等需要高效记录的人群有帮助,同时也惠及聋人和听力障碍人士,他们使用 AI 转录来辅助沟通。

🏷️

标签

➡️

继续阅读