Wan 3.0现已上线AI网关

Wan 3.0现已上线AI网关

💡 原文英文,约400词,阅读约需2分钟。
📝

内容提要

阿里云Wan 3.0视频模型已上线AI网关,支持文生视频、图生视频、首尾帧及参考生成,输出最长30秒、30fps、最高1080p并含音频。提供轮询、异步任务及Webhook三种生成方式,支持图像、视频、音频参考,简化了多模型流程。

🔎

延伸解读

模型整合与能力升级

Wan 3.0将此前Wan 2.7中分离的文生视频(-t2v)和图生视频(-r2v)模型整合为一个统一模型,并新增首尾帧控制和参考生成能力。输出规格也显著提升:时长从15秒延长至30秒,帧率从24fps提升至30fps,分辨率最高支持1080p,且默认包含音频。这一整合简化了多模型流程,降低了开发者的集成成本。

异步生成方式的选择

AI网关为Wan 3.0提供了三种异步生成方式:轮询(poll)适合需要简单同步等待的场景,SDK会定期查询状态;异步任务(startVideo)则立即返回任务ID,适合服务端无状态或批量任务;Webhook方式在生成完成时主动推送事件,无需轮询。开发者可根据应用架构选择最合适的方式,以平衡延迟和资源消耗。

参考输入的限制

Wan 3.0支持图像、视频和音频作为参考输入,但存在限制:音频参考必须使用托管URL,而图像参考可接受base64编码;首尾帧控制仅各接受一张图像,且不能与其他参考方式组合使用。开发者需注意这些约束,合理设计输入格式,避免因格式不符导致调用失败。

Q&A

阿里云Wan 3.0视频模型在AI网关上的模型ID是什么?

模型ID是alibaba/wan-v3.0-video。

Wan 3.0支持哪些视频生成方式?

Wan 3.0支持文生视频、图生视频、首尾帧生成和参考生成。

Wan 3.0生成的视频规格是什么?

视频最长30秒,帧率30fps,分辨率可选480p、720p或1080p,默认包含音频。

AI网关为Wan 3.0提供了哪三种异步生成方式?

三种方式:轮询(poll)、异步任务(startVideo)和Webhook回调。轮询会持续请求状态直到完成;异步任务立即返回,任务在后台运行;Webhook在生成完成时推送事件到指定端点。

Wan 3.0支持哪些类型的参考输入?

支持图像、视频和音频作为参考。图像可以接受URL或base64,音频必须使用托管URL。

Wan 3.0的首尾帧生成有什么限制?

首尾帧生成需要各一张图像,且不能与其他参考输入结合使用。

Wan 3.0相比Wan 2.7有哪些改进?

Wan 3.0将多个模型整合为一个,支持更多生成方式,视频时长从15秒提升到30秒,帧率从24fps提升到30fps。

🏷️

标签

➡️

继续阅读