内容提要
阿里云栖大会发布全模态模型矩阵,涵盖千问基座、图像、视频、语音、音乐及世界模型。导演陆川借助AI仅用5天复原明代爆炸场景,准确率超95%。阿里判断三年内将出现原生全模态统一生成模型,AI正从单项生成走向理解完整叙事、协同完成复杂任务。
延伸解读
从“抽卡”到“叙事”:多模态创作的最后一公里
王珞丹熬夜抽卡的经历,暴露了当前多模态创作的核心痛点:单个镜头生成质量再高,一旦故事变长,人物状态、情绪和气质就难以保持一致。创作者需要AI记住前面的内容,跟随同一个故事推进,而非每次切换模态都像重新开始对话。这不仅是技术问题,更关乎创作流程的连贯性。
专业场景的考验:稳定生产比榜单排名更重要
Wan3.0在文生视频榜单上位列第一,但进入广告等商业场景后,评价标准变为能否稳定交付、连续工作、理解同一任务。商品外观、Logo、口播只要有一处漂移,整条片子就难以直接使用。陆川的《历史·现场》之所以典型,是因为它把AI带到了需要史料严谨性和导演意图理解的专业位置,这远超通用生成的要求。
音乐产业的AI焦虑:版权与收益分配绕不过去
太合音乐集团总裁余灏指出,AI降低音乐创作成本的同时,也带来训练素材获取、版权归属、AI翻唱授权和收益分配等产业规则问题。无授权AI翻唱成本过低,大量版本泛滥会侵蚀原版版权方和艺人的价值。AI音乐已从创作工具进入产业规则层面,需要新的机制来平衡各方利益。
原生全模态:从“接力”到“统一”的下一阶段
当前多模态系统更像接力:图像、视频、音乐模型各管一段,Agent再调不同工具,但每次交接都可能丢失上下文。阿里判断三年内会出现原生全模态统一生成模型,不同模态从底层共享同一任务、上下文和世界理解。下一代视频模型将于11月发布,方向之一是从生成单个镜头走向理解完整叙事,即“Agentic Video”。
Q&A
阿里云在2026云栖大会上发布了哪些全模态模型?
阿里云在云栖大会上发布了全模态模型矩阵,包括千问基座模型(Qwen3.8-Max、Qwen3.8-Flash、Qwen3.8-Omni等)、图像生成模型Qwen-Image-3.1、音乐生成模型Happy Shrimp 1.1、世界模型HappyOyster 2.0 Preview、语音模型家族Qwen-Audio-3.1、同声传译模型Qwen3.8-LiveTranslate,并预告下一代视频生成模型将于11月发布。
陆川导演如何用AI在5天内复原明代爆炸场景?
陆川团队将史料文字翻译成现代视觉概念,经过约四轮提示词优化,并参考真实爆炸影像进行校准,利用阿里视频生成模型对烟尘、碎片等复杂画面进行还原,准确度达到团队预期的95%以上,从而在5天内完成了传统影视工业需要数月和千万级投入的场景复原。
阿里判断多模态模型的未来发展方向是什么?
阿里判断三年内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。该模型将从底层共享同一个任务、同一份上下文和同一套世界理解,让图像、视频、声音、空间、动作都围绕同一个目标协同工作,解决当前多模态系统接力式协作导致的上下文割裂问题。
当前多模态创作面临的主要挑战是什么?
当前多模态创作的主要挑战是:单个镜头生成能力越来越强,但故事一长,人物的状态、情绪和气质很难一直保持,AI难以记住前面的内容并持续跟随同一个故事。每切换一次模态就像重新开始对话,上下文容易丢失,无法支撑复杂任务。
AI音乐进入产业后需要解决哪些问题?
AI音乐进入产业后需要解决训练素材获取、版权计算、AI翻唱授权、收益分配等问题。太合音乐集团总裁余灏指出,无授权AI翻唱成本太低,大量版本泛滥会侵蚀原版版权方和艺人的价值,因此需要建立音乐人共创、产业生态、版权机制和AI音乐新消费场景。
阿里多模态模型在专业创作中如何协同工作?
阿里多模态模型通过分工协同:Qwen负责语言、知识和推理;Image、Wan、Happy Horse、Audio、Happy Shrimp将能力延伸至视觉、影像、声音和音乐;HappyOyster处理三维空间和交互环境;Omni处理不同模态间的统一理解;Agent将能力接入实际任务,形成完整工作流。