AI Gateway新增异步视频生成功能,支持webhook回调、轮询、启动后查询及默认同步四种方式。用户可根据进程是否可等待或接收webhook选择方案。SDK已更新,支持文本转视频等输入,异步任务可在日志页监控,操作可序列化存储,便于后续查询。
谷歌推出Veo 3.1 Lite视频模型,成本低于Veo 3.1 Fast,支持文本和图像转视频,提供灵活的画幅和分辨率。4月7日将降低Veo 3.1 Fast价格,以便更多开发者使用。
Runway推出的Gen-4.5文本转视频AI模型在生成视觉效果方面更加精准,能够处理复杂提示,产生“电影级”和高度真实的输出。该模型在物理准确性和视觉精度上达到前所未有的水平,生成的物体运动更具真实感。尽管存在物体持久性和因果推理问题,Runway声称其生成的视觉效果与真实世界几乎无法区分。
TryVeo3.ai 是一款免费的 AI 工具,能够将文本或图像转换为包含音效和对话的完整视频。用户只需输入场景描述,系统便可生成短片,适合快速创作和原型设计。
HeyGem.ai 是一个开源的数字人克隆代理,支持本地部署和API服务。KrillinAI 提供简化的视频翻译和配音工具。EOS 优化能源使用,支持多平台。text-to-video-synthesis-colab 将文本转换为视频,提供多种模型和教程。soundstorm-pytorch 高效生成音频。
谷歌为Gemini Advanced订阅者推出Veo 2,一个高分辨率的文本转视频AI模型,用户可生成720p的八秒视频,并直接分享至TikTok和YouTube。Veo 2具备更强的物理理解和人类动作表现,生成的视频带有数字水印。此外,谷歌还推出Whisk Animate工具,允许用户将图像转换为视频。
Signal-Android 是一款安全的即时通讯应用,支持高保真消息和语音视频通话。ai-agents-for-beginners 提供构建 AI 代理的基础课程,包含 Python 示例。sumo 是开源交通仿真包,支持多模式仿真。weekly 分享独立开发成功案例,text2video 可将文本转换为视频。
Wan 2.1是一个开源视频生成模型,能够将文本转换为视频,支持中英文生成。它具备视频时间压缩、音效同步和复杂物理运动模拟等功能,推动视频创作的未来,适合个性化内容和互动叙事的开发者使用。
Goku AI是字节跳动开发的开源文本转视频模型,具备快速生成和图像动画功能,优于OpenAI的Sora。尽管在处理复杂提示方面存在不足,但其低成本和高效能使其成为内容创作者的理想选择。
作者计划在2025年3月前开发一个免费的文本转视频AI,类似于CHATGPT,并寻求建议。他还询问学习此类模型的关键知识,并考虑将其开源。
OpenAI推出了Sora,一个文本转视频生成模型,能够根据文本指令创建逼真的视频场景。Sora支持1080p视频生成,时长可达20秒,并能将静态图像转为视频,理解复杂的物理互动。尽管存在一些限制,Sora为创作者提供了新的可能性,推动数字内容创作的未来。
OpenAI于周一推出了文本转视频AI模型Sora,供ChatGPT订阅用户使用。该模型支持从文本生成视频、动画和视频混合。ChatGPT Plus用户可生成50个优先视频,分辨率最高720p;而ChatGPT Pro用户则可无限生成500个优先视频,分辨率可达1080p。生成的视频将带有水印和C2PA元数据,用户需遵守上传协议。
OpenAI计划于12月5日起进行为期12天的发布活动,推出包括文本转视频工具Sora在内的新功能和产品。CEO Sam Altman确认了这一计划,但未透露具体细节。Sora的推出引发了艺术家的抗议,数百名艺术家参与了测试。同时,谷歌也推出了其生成性AI视频模型Veo。
在第174期播客中,讨论了AI行业的最新进展与挑战,包括Odyssey的文本转视频模型、Groq的快速LLM引擎,以及OpenAI面临的监管压力。此外,还提到AMD收购Silo AI和埃隆·马斯克的GPU集群计划等重要投资和技术进展。
OpenAI的Sora文本转视频生成器将于今年晚些时候向公众开放,能够根据文本提示生成超现实场景,未来计划加入音频功能。Sora使用的数据主要来自公开或授权的数据,并与Shutterstock合作。发布时,Sora将对公众人物的图像生成有限制,并在视频上添加水印以防误用。
完成下面两步后,将自动完成登录并继续当前操作。