杀死AI视频的,不是更好的AI视频模型 - 蝈蝈俊

杀死AI视频的,不是更好的AI视频模型 - 蝈蝈俊

💡 原文中文,约2800字,阅读约需7分钟。
📝

内容提要

AI视频生成正从扩散模型转向代码模型。Claude Opus 5.5用Three.js重做《桃花源记》3D交互版,不生成画面,而是写代码让浏览器渲染可交互场景。代码模型优势在可控性:每帧可查可改,算力可复用;视频模型擅长感知真实感。两者并非取代,而是分工——代码决定发生什么,视频模型决定看起来怎样。OpenAI已优先投入Codex。

🔎

延伸解读

可控性:代码模型的核心优势

文章指出,代码模型生成视频的优势在于可控性。在扩散模型中,用户无法精确控制每一帧的内容,只能通过提示词碰运气。而代码模型如Three.js,允许开发者直接修改坐标、路径等参数,实现精确控制。例如,在《桃花源记》项目中,场景中的每个元素都是代码中可定位、可修改的对象。这种可控性使得代码模型在教学、数据可视化等需要结构化控制的场景中更具优势。

算力架构:沉没成本 vs 流动资产

文章对比了两种模型的算力消耗模式。视频扩散模型的算力是连续且独占的,生成一段视频需要从头到尾运行,算力很难复用,属于“沉没成本”。而代码模型的算力是碎片且可复用的,通过KV cache、continuous batching等技术,同一块GPU可以在多个agent工作流之间交错调度,算力成为“流动资产”。这种差异影响了公司的投入决策,如OpenAI优先投入Codex。

分工而非取代:代码与视频模型的协作

文章强调,代码模型和视频模型并非取代关系,而是分工协作。代码模型负责决定世界里发生什么,视频模型负责决定看起来怎样。例如,可以用代码生成分镜和控制,再交给视频模型进行高画质渲染。这种分工结合了代码的符号一致性和视频模型的感知真实性,适用于不同需求场景。

应用场景的分化

文章指出,视频生成的重心正从“更好看的画面”转向“更可靠的控制”。因此,结构化、可控性需求强的场景,如教学视频、数据可视化、游戏引擎逻辑、交互式叙事,正在向代码模型迁移。而感知真实感需求强的场景,如自然景观、人物表演、复杂光照,仍属于视频扩散模型。这种分化意味着两种技术将各自服务于不同的应用领域。

❓

Q&A

AI视频生成从扩散模型转向代码模型,具体是怎么实现的?

代码模型不直接生成视频画面,而是通过编写代码(如Three.js程序)让浏览器渲染出可交互的3D场景。例如Claude Opus 5.5重做《桃花源记》3D交互版时,先理解全文、拆解场景和叙事元素,确定人物和物体在三维坐标中的位置,然后写出一套Three.js程序,最终呈现的“视频”本质上是代码在运行。

代码模型和视频模型在可控性上有什么本质区别?

代码模型生成的内容每一帧都可查可改,因为代码是可读的,你可以打开程序看到坐标、路径等具体设置并直接修改。而视频模型(如Sora)生成过程是黑盒,你只能通过提示词碰运气,无法精确控制每一帧中角色的动作或位置。

为什么OpenAI优先投入Codex而不是Sora?

奥特曼在播客中表示,Sora继续做也能成为不错的生意,但“实在太吃compute”,同一时期Codex的优先级更高,算力和团队投入开始向Codex倾斜。此外,Sora日均运行成本约1500万美元,年化烧钱约54亿美元,但累计收入占比极低,30天留存率仅1%左右。

代码模型和视频模型在算力架构上有什么不同?

Sora的算力是连续且独占的,生成视频需要让巨大的时空latent经过多轮Transformer计算,每轮采样面对新的时空状态,很难复用历史来摊薄成本。Codex的算力是碎片且可复用的,通过KV cache、continuous batching和工具等待,同一块GPU可以在多个agent工作流之间交错调度,算力是“流动资产”。

代码模型会完全取代视频模型吗?

不会。卡帕西在评论区指出,程序化3D和视频生成并不是二选一。两者是分工关系:代码决定世界里发生什么,视频模型决定这一切看起来如何。代码驱动的是符号一致性,视频模型擅长感知真实性,如自然景观、人物表演、复杂光照等。

哪些场景更适合用代码模型生成视频?

结构化、可控性需求最强的场景正在向代码模型迁移,包括教学视频、数据可视化、游戏引擎逻辑、交互式叙事。例如宝玉做《桃花源记》的初衷是帮助理解课文,教学需要的是可交互、可探索、可反复修改的结构化场景,而不是一段好看的视频。

🏷️

标签

➡️

继续阅读