AI Gateway 现已支持流式转录

AI Gateway 现已支持流式转录

💡 原文英文,约300词,阅读约需1分钟。
📝

内容提要

AI Gateway新增流式转录功能,支持边捕获音频边输出实时转录结果,降低延迟,适用于实时字幕和语音输入。该功能处于测试阶段,可通过AI SDK的streamTranscribe函数使用,兼容多种模型如OpenAI和xAI,并支持为智能体添加语音模式,无需改动现有文本处理流程。

🔎

延伸解读

流式转录的适用场景

流式转录的核心优势在于低延迟,适合实时字幕和语音输入等场景。相比传统转录需等待完整音频文件,流式转录可在音频捕获的同时输出结果,显著减少等待时间。对于需要即时反馈的应用,如直播字幕或语音助手,这一功能能提升用户体验。

模型兼容性与切换

AI Gateway的流式转录支持多种模型,如OpenAI的gpt-realtime-whisper和xAI的grok-stt。开发者只需更换模型字符串即可切换提供商,无需修改其他代码。这种灵活性便于比较不同模型的性能或根据成本、质量选择最合适的方案。

与现有智能体集成

流式转录可轻松为文本智能体添加语音模式。通过将用户语音流式转录为文本,再传递给智能体,智能体本身无需改动,仍处理文本输入。这降低了集成复杂度,使现有文本智能体能快速支持语音交互,同时可结合语音生成实现双向对话。

Q&A

AI Gateway 的流式转录功能是什么?

AI Gateway 新增的流式转录功能允许在捕获音频的同时实时输出转录结果,而不是等待完整音频文件上传后才返回完整转录。这降低了延迟,适用于实时字幕和语音输入等场景。

如何使用 AI Gateway 的流式转录功能?

可以通过 AI SDK 的 streamTranscribe 函数使用,该函数接受模型和音频流等参数,并返回一个包含转录增量的流。示例代码展示了如何将原始 PCM 音频流式传输到 openai/gpt-realtime-whisper 模型,并打印每个转录增量。

AI Gateway 流式转录支持哪些模型?

支持任何支持流式转录的模型,例如 OpenAI 的 gpt-realtime-whisper 和 xAI 的 grok-stt。只需更换模型字符串即可切换提供商。

流式转录与之前的转录方式有何不同?

之前的转录需要完整的音频文件,并一次性返回完整转录;而流式转录可以在音频捕获过程中实时返回转录更新,从而降低延迟。

流式转录如何用于智能体?

可以将用户的语音流式传输到转录模型,然后将实时文本传递给智能体。智能体本身无需更改,因为它仍然接收文本,因此适用于任何基于文本的智能体。若需要语音回复,可搭配语音生成或使用实时语音进行双向对话。

流式转录功能目前处于什么阶段?

该功能目前处于测试阶段(beta)。

🏷️

标签

➡️

继续阅读