内容提要
字节的 Seed-Audio 音频生成模型能力强、可控性高,但官方资料少且冷门。作者为此开发开源 Skill,采用 7 步工作流,将故事目标分解并生成多段音频,面向短剧、漫剧等故事性创作。使用需配置 SEED_AUDIO_API_KEY 并安装 ffmpeg。核心难点是构造统一的复合音频 prompt,作者还从豆包官方 Skill 中提取提示词技巧并整理成文档。
延伸解读
Seed-Audio 的定位与现状
文章指出,Seed-Audio 在字节体系内地位冷门,远不如 Seedance 受重视,官方资料极少,甚至没有发布会或官方群。但作者认为其音频生成能力与 Seedance 在视频领域同级,可控性高,能根据复杂指令生成声音。这种官方支持与模型能力的落差,是作者开发此 Skill 的背景。
Skill 的适用场景与限制
该 Skill 目前只针对故事性创作,如短剧、漫剧,暂不支持艺术类创作如歌曲、乐曲。它采用 7 步工作流,将故事目标分解并生成多段音频。使用前需配置 SEED_AUDIO_API_KEY 并安装 ffmpeg。作者强调,最核心也最难的步骤是构造统一的复合音频 prompt。
提示词技巧的获取途径
由于 Seed-Audio 公开资料稀缺,作者从豆包官方 Skill 中提取提示词技巧。豆包工作模式下提供了 Seed-Audio 1.0 的专门 Skill,是目前官方唯一能获得使用技巧的渠道。作者通过多次运行该 Skill 并让其总结,最终整理成文档,放在 GitHub 上供参考。
Q&A
seed-audio-long-story-workflow 这个 Skill 是做什么的?
这是一个开源 Skill,用于通过 7 步工作流将用户输入的故事目标分解,并生成多段音频,主要面向短剧、漫剧等故事性创作。
使用这个 Skill 需要提前配置哪些环境?
需要在环境变量中配置 SEED_AUDIO_API_KEY(可从火山引擎控制台获取),并安装 ffmpeg 且确保命令可用。
这个 Skill 的工作流包含哪些步骤?
工作流共 7 步,核心是通过对故事目标进行分解,最终生成多段音频。
为什么说构造统一的复合音频 prompt 是最难的步骤?
因为 seed-audio 公开资料极少,官方没有详细介绍提示词技巧的文章、发布会或官方群,导致构造 prompt 非常困难。
从哪里可以获得 seed-audio 的官方提示词技巧?
可以从豆包获取。豆包的工作模式下提供了 seed audio 1.0 的专门 Skill,是目前官方唯一能获得使用技巧的地方。
这个 Skill 目前支持哪些类型的创作?
目前只针对故事性创作,例如短剧、漫剧,暂不考虑艺术类创作如歌曲、乐曲等。