81.8 秒的视频,我们改了 15 个版本:一次纯 Codex 驱动的 AI-native 视频实践

81.8 秒的视频,我们改了 15 个版本:一次纯 Codex 驱动的 AI-native 视频实践

💡 原文中文,约6000字,阅读约需15分钟。
📝

内容提要

文章介绍了一种纯AI链路制作产品视频的方法:作者只负责目标、选择与反馈,由Codex完成脚本、分镜、动效、配音、配乐、混音、审片和渲染,最终产出81.8秒成片,迭代15版。核心方法包括:先让AI理顺故事,用参考画面代替模糊要求,让动效服务因果关系,配音音乐服务叙事,并用“效果+参考+保留+标准”反馈。关键底座是HeyGen开源的HTML转视频框架HyperFrames。

🔎

延伸解读

纯 AI 驱动视频制作的核心:单一 Agent 维护全链路

文章强调“纯 AI 驱动”并非多个工具拼接,而是同一个 Agent 持续维护从脚本到渲染的整条制作链路。它能记住上一轮修改的原因,调用语音、音乐、视频等工具,避免人工在不同工具间充当“传话筒”。这种模式让没有专业剪辑经验的人也能通过持续对话,把想法逐步变成成片,真正减掉的是工具切换和重复协调的负担。

用参考画面代替模糊要求,让审美可执行

“更高级”“更有科技感”这类要求难以落地,因为解释空间太大。文章建议把审美偏好变成可观察的参考,例如从 HeyGen HyperFrames 官方案例中挑选接近目标的片段,让 AI 拆解信息层级、卡片入场和镜头推进等“画面零件”,再用自己的品牌和内容重新组合。这样,“我喜欢什么”就变成了 AI 可以执行和验证的约束,无需掌握动画术语也能有效指导修改。

HyperFrames 的定位:适合产品 UI 与动态图表的 AI 视频底座

HyperFrames 是 HeyGen 开源的 HTML-to-video 框架,Agent 用 HTML、CSS 和 JavaScript 搭建画面,再稳定渲染成 MP4,并保留可继续编辑的工程文件。它特别适合产品界面、数据、关系网络和流程演示,因为 AI 熟悉网页代码,能轻松定位元素并修改,且预览与成片容易保持一致。文章也对比了 Remotion 和 ChatCut,指出若素材以实拍访谈为主,ChatCut 更顺手;若需 React 视频模板和批量渲染,Remotion 更成熟。

反馈结构:把观看感受翻译成可执行的修改指令

文章推荐用“效果+参考+保留+标准”四要素来反馈,例如“这一段像功能清单,我希望观众先看到问题,再看到 AI 怎么处理;保留两条关键数据,做完后给我看前后各 2 秒”。这种结构不需要专业参数,只需表达直觉感受,AI 就能联动修改脚本、画面、声音和版本。它让审片从模糊的“感觉不对”变成具体可验证的指令,是纯 AI 链路中最高效的协作方式。

Q&A

如何用纯AI链路制作一支产品视频?

文章介绍的方法:你只负责目标、选择和反馈,由Codex完成脚本、分镜、动效、配音、配乐、混音、审片和渲染。具体步骤包括:先让AI理顺故事,用参考画面代替模糊要求,让动效服务因果关系,配音音乐服务叙事,并用“效果+参考+保留+标准”反馈。最终产出81.8秒成片,迭代15版。

HyperFrames是什么?它在AI视频制作中起什么作用?

HyperFrames是HeyGen团队开源的HTML-to-video框架。你描述想要的视频,Agent使用HTML、CSS和JavaScript搭建画面;HyperFrames再把网页中的文字、图片、视频、图表和动画稳定渲染成MP4。项目保留可继续编辑的文件,下一轮仍可接着改。它适合AI做视频,因为AI熟悉网页代码,每轮都能继续编辑,预览和成片更容易保持一致。

HyperFrames、Remotion和ChatCut分别适合什么场景?

HyperFrames适合产品UI、动态图表、流程、动效宣传片,适合想让AI从想法直接搭建画面的人;Remotion适合参数化模板、批量视频、嵌入产品的视频能力,适合熟悉React的开发团队;ChatCut适合实拍素材剪辑、访谈与口播、字幕、B-roll和多轨包装,适合已有大量原始视频的人。它们可以组合使用。

怎样给AI反馈才能有效修改视频?

使用四项反馈结构:想达到的效果 + 可参考的画面 + 必须保留的内容 + 怎样算改好。例如:“这一段像功能清单。我希望观众先看到问题,再看到AI怎么处理;保留两条关键数据,做完后给我看这一段前后各2秒。”这样AI能联动修改脚本、画面、声音和版本。

如何让视频动效更好地服务故事?

动效的任务是带着观众看。先问:这一秒希望观众看哪里?视线接下来往哪里走?动作结束后留下什么信息?表现力来自更强的因果关系和证据接力。常用四类动效:让信息按关系出现;让重点自己“说话”;让转场延续上一镜;给画面留出安静时刻。旁白里的每个主张,画面要能证明。

如何为AI视频选择配音和音乐?

配音:先试听角色,用三类真实文案测试(情绪钩子、信息密集句、片尾口号),比较母语感、重音、术语发音和长时间聆听的疲劳感。音乐:画面基本锁定后,把整支视频作为参考交给音乐模型,描述前段有调查和推进感,中段逐渐展开,结尾需要明确抬升,整体克制,给中文旁白留空间。选音乐时重点听开场、转折和片尾。

🏷️

标签

➡️

继续阅读