开源一个Skill「seed-audio-long-story-workflow」帮你创作声音故事

开源一个Skill「seed-audio-long-story-workflow」帮你创作声音故事

💡 原文中文,约2500字,阅读约需6分钟。
📝

内容提要

字节的 Seed-Audio 音频生成模型能力强、可控性高,但官方资料少且冷门。作者为此开发开源 Skill,采用 7 步工作流,将故事目标分解并生成多段音频,面向短剧、漫剧等故事性创作。使用需配置 SEED_AUDIO_API_KEY 并安装 ffmpeg。核心难点是构造统一的复合音频 prompt,作者还从豆包官方 Skill 中提取提示词技巧并整理成文档。

🔎

延伸解读

Seed-Audio 的定位与现状

文章指出,Seed-Audio 在字节体系内地位冷门,远不如 Seedance 受重视,官方资料极少,甚至没有发布会或官方群。但作者认为其音频生成能力与 Seedance 在视频领域同级,可控性高,能根据复杂指令生成声音。这种官方支持与模型能力的落差,是作者开发此 Skill 的背景。

Skill 的适用场景与限制

该 Skill 目前只针对故事性创作,如短剧、漫剧,暂不支持艺术类创作如歌曲、乐曲。它采用 7 步工作流,将故事目标分解并生成多段音频。使用前需配置 SEED_AUDIO_API_KEY 并安装 ffmpeg。作者强调,最核心也最难的步骤是构造统一的复合音频 prompt。

提示词技巧的获取途径

由于 Seed-Audio 公开资料稀缺,作者从豆包官方 Skill 中提取提示词技巧。豆包工作模式下提供了 Seed-Audio 1.0 的专门 Skill,是目前官方唯一能获得使用技巧的渠道。作者通过多次运行该 Skill 并让其总结,最终整理成文档,放在 GitHub 上供参考。

Q&A

seed-audio-long-story-workflow 这个 Skill 是做什么的?

这是一个开源 Skill,用于通过 7 步工作流将用户输入的故事目标分解,并生成多段音频,主要面向短剧、漫剧等故事性创作。

使用这个 Skill 需要提前配置哪些环境?

需要在环境变量中配置 SEED_AUDIO_API_KEY(可从火山引擎控制台获取),并安装 ffmpeg 且确保命令可用。

这个 Skill 的工作流包含哪些步骤?

工作流共 7 步,核心是通过对故事目标进行分解,最终生成多段音频。

为什么说构造统一的复合音频 prompt 是最难的步骤?

因为 seed-audio 公开资料极少,官方没有详细介绍提示词技巧的文章、发布会或官方群,导致构造 prompt 非常困难。

从哪里可以获得 seed-audio 的官方提示词技巧?

可以从豆包获取。豆包的工作模式下提供了 seed audio 1.0 的专门 Skill,是目前官方唯一能获得使用技巧的地方。

这个 Skill 目前支持哪些类型的创作?

目前只针对故事性创作,例如短剧、漫剧,暂不考虑艺术类创作如歌曲、乐曲等。

🏷️

标签

➡️

继续阅读