内容提要
Sora是一种能用文本生成最长60秒视频的技术,也可以生成图片。与其他AI视频生成工具相比,Sora生成视频质量更高,支持镜头切换、画面稳定和高画质。生成60秒视频的成本约为10美元。未来可能实现更长时间的视频生成。Sora的应用场景包括提升表达能力、降低视频制作成本、动态生成游戏剧情和保留亲人记忆等。Sora的竞争力较强,中国在这个领域的发展情况良好。
延伸解读
技术突破:时空补丁与扩散Transformer
Sora基于Diffusion Transformer模型,结合扩散模型和Transformer,预测生成“时空补丁”而非文本Token。这种设计让训练不受视频和显卡约束,生成时能灵活组合,支持镜头切换、画面稳定和高画质,从而在质量上显著超越Pika等工具。
成本与算力:生成60秒视频约10美元
据推测,Sora推理需约8块A100显卡,生成60秒视频成本约10美元,耗时约半小时。未来可能实现5-10分钟视频,但更长时长如30分钟预计需3-5年。高成本可能限制使用次数或推动更高档订阅。
应用前景:放大表达与情感寄托
Sora能放大普通人的表达能力,降低视频制作成本,并动态生成游戏剧情或新闻视频。还可用于生成已故亲人视频,提供情感寄托。其赚钱逻辑涵盖情感、艺术、内容、生态和降本增效等多方面价值。
竞争格局:OpenAI领先,中国追赶中
OpenAI在Sora上投入一年多,领先业界半年到一年。中国在AI视频领域有深厚积累,字节、阿里、腾讯、百度等大厂有机会追赶,但差距主要在于技术方向把握和算力自给自足。未来视频生成赛道将持续热门。
Q&A
Sora是什么?它能生成多长的视频?
Sora是一种能用文本生成最长60秒视频的技术,也可以用来生成图片,因为图片本质上是一帧的视频。
Sora和Runway、Pika等AI视频生成工具有什么区别?
Sora生成视频的质量比之前的高很多,不仅时间最长能到60秒,而且支持镜头切换、画面人物和背景稳定、很高画质。Pika基于Diffusion模型,一次只能生成几秒钟的视频;Sora基于Diffusion Transformer模型,结合了扩散模型和Transformer模型,预测生成的是“时空补丁”,训练时不受视频和显卡约束,生成时也更加多样。
Sora生成视频的成本大概是多少?对算力有什么要求?
Sora没有公布相关数据,纯猜测:Sora的推理大约需要~8xA100,生成视频预估一秒一分钟,半小时成本约~$10。生成视频时间越长对显存要求越高。
Sora有哪些应用场景?能用来做什么?
Sora的应用场景包括:放大普通人的表达能力,成为“嘴替”;作为低成本的视频工具,降低视频制作成本;新的人机交互方式,动态生成视频,如生成游戏剧情、任务、场景,或对新闻、文章生成视频;情感上的寄托,如生成已故亲人的视频,保留记忆,数字伴侣。
Sora什么时候能生成更长时间的视频,比如30分钟甚至更长?
生成视频时间越长对显存要求越高,但是按照现在技术发展的速度,乐观估计1年后应该可以到5-10分钟,30分钟60分钟预计在3-5年的时间。
Sora的赚钱逻辑有哪些?普通人如何利用Sora做副业?
Sora的赚钱逻辑取决于围绕它创造的价值:情感价值(卖课缓解焦虑、提供娱乐、情感寄托)、艺术价值(微电影)、内容价值(小说二创、卖素材、教学、讲故事、游戏生成、广告)、生态价值(Prompt、更加易用小工具、绕过限制)、降本增效(快速MVP验证想法、广告、电商、电影分镜)。普通人可以:用起来,学会怎么用,知道它能做什么,边界在哪里;选一个适合自己的方向,提前准备好相关素材或者开发项目;技术人员可以准备开始筹备产品、工具:收集Prompt、基于API二次开发。
Sora的竞争力如何?中国在AI视频领域的发展情况怎样?
OpenAI已经投入了一年多,领先业界半年到一年,甚至更多,具体体现在技术的领先和大模型的优势。中国应该很快能追赶上——人才、数据、算力都有,但是只有少数大厂才有机会,对人才、数据、算力要求都太高。目前不清楚是否中国公司已经有做这个方向的,但是字节、阿里、腾讯、百度在AI视频领域都有深厚积累。中国和欧美的差距主要在于对AI技术方向上的把握,另外就是算力上还不能完全自给自足。
如何判断视频是Sora生成的还是真实拍摄的?深度伪造问题怎么解决?
现在的视频都有水印,未来应该会有检测工具。另外仔细看是能看出视频中不符合逻辑的地方,例如蚂蚁只有4条腿,人的手会变形等等。我们其实早已经历过:照片不是真的、电视不是真的、电影不是真的,人民群众的鉴别水平也会同步提升。伪造和鉴别伪造是长期攻防战。