Fish Audio模型现已在Vercel AI Gateway上免费提供

Fish Audio模型现已在Vercel AI Gateway上免费提供

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

Fish Audio的音频模型已上线AI Gateway,庆祝期间所有模型免费至9月18日。提供四个模型,包括文本转语音(支持低延迟、语音克隆、多语言及情感标记)和语音转文本(带时间戳)。用户可通过标准名称或加“-free”后缀使用,后者在优惠结束后自动停止服务。支持代码和浏览器试玩。

🔎

延伸解读

免费期后如何避免意外扣费

文章明确指出,使用标准模型名(如 fish-audio/s2.1-pro)在优惠期内免费,但优惠结束后会自动开始计费。若想确保不产生费用,需在模型名后添加“-free”后缀(如 fish-audio/s2.1-pro-free),这样优惠结束后模型将停止服务。开发者应特别注意这一点,以免在不知情的情况下产生费用。

模型选择与功能差异

Fish Audio 提供四个模型,各有侧重:s2.1-pro 支持低延迟流式输出和语音克隆;transcribe-1 用于语音转文字,返回带时间戳的片段;s2-pro 支持约八十种语言,并可通过文本内标签调整单个词或短语的发音风格;s1 则支持情感、语气和音效标记。开发者可根据具体需求选择合适的模型。

试用方式与集成

除了通过代码调用,用户还可以在 Playground 中直接试用模型,无需编写代码。代码示例展示了如何使用 AI SDK 7 中的 generateSpeech 和 transcribe 函数,分别实现文本转语音和语音转文字。音频文件可保存为 mp3,转录结果包含分段时间戳,便于后续处理。

Q&A

Fish Audio模型在AI Gateway上免费使用到什么时候?

Fish Audio模型在AI Gateway上免费使用至9月18日,为期30天。

Fish Audio在AI Gateway上提供了哪些模型?

提供了四个模型:fish-audio/s2.1-pro(文本转语音,支持低延迟和语音克隆)、fish-audio/transcribe-1(语音转文本,带时间戳)、fish-audio/s2-pro(文本转语音,支持约80种语言和内联标签)、fish-audio/s1(文本转语音,支持情感、语气和音效标记)。

如何在免费期结束后避免被自动收费?

在模型名称后加上“-free”后缀,例如fish-audio/s2.1-pro-free,这样优惠结束后模型会自动停止服务,不会产生费用。

Fish Audio的文本转语音模型支持哪些功能?

支持低延迟流式传输、从参考录音克隆声音、多语言(约80种语言)、内联标签控制发音,以及情感、语气和音效标记。

Fish Audio的语音转文本模型有什么特点?

fish-audio/transcribe-1模型可以返回文本,并提供音频时长和带时间戳的片段,时间戳精确到单词级别。

如何在代码中使用Fish Audio的文本转语音功能?

使用AI SDK的generateSpeech函数,指定模型为fish-audio/s2.1-pro,传入文本,然后可以将返回的音频写入文件。示例代码:const result = await generateSpeech({ model: 'fish-audio/s2.1-pro', text: 'How are you doing today?' }); await writeFile('speech.mp3', result.audio.uint8Array);

如何在不写代码的情况下试用Fish Audio模型?

可以在AI Gateway的模型列表中点击模型,直接在浏览器中发送文本或音频进行试听或查看结果。

🏷️

标签

➡️

继续阅读