内容提要
清华系团队Sand.ai发布开源视频生成模型MAGI-2-preview,总参数114B,激活仅6B,生成10秒1080P视频成本约5毛钱,为行业主流十分之一。采用MoE架构和单流设计,音画同步建模,自研系统优化通信,在AA榜单排名第六,推动千亿级视频MoE开源,重塑行业竞争格局。
延伸解读
成本优势的真相
文章称生成10秒1080P视频成本约5毛钱,仅为行业主流十分之一。但需注意,这一估算基于8卡H100的当前行情,且仅计算推理成本,未包含训练、部署、运维等费用。实际落地成本可能更高,尤其对于需要私有化部署的企业,硬件投入和专家通信开销不可忽视。
MoE架构的挑战
MAGI-2-preview采用MoE架构,总参数114B但激活仅6B,通过细粒度专家(每层3072个)和自研系统优化通信,解决了视频长序列下的通信瓶颈。然而,MoE的专家路由稳定性、负载均衡等问题在训练中仍需谨慎处理,且6B激活参数的实际计算成本高于同等规模的稠密模型,部署时需权衡性能与资源消耗。
开源的意义
开源千亿级视频MoE模型,为研究者和企业提供了前所未有的机会。研究者可深入分析专家分工、路由机制等内部细节,推动视频生成技术发展;企业则能私有化部署,满足数据敏感行业的需求。开源也加剧了与闭源模型的竞争,未来视频生成领域可能像语言模型一样,形成开源与闭源并存的格局。
Q&A
MAGI-2-preview是什么?它的主要特点是什么?
MAGI-2-preview是清华系团队Sand.ai开源的视频生成模型,总参数114B,激活参数仅6B,采用MoE架构和单流设计,支持音画同步建模,生成10秒1080P视频成本约5毛钱,在AA榜单排名第六。
MAGI-2-preview生成视频的成本是多少?相比行业主流如何?
生成一段10秒1080P视频的成本约5毛钱,大约是行业主流模型的十分之一。
MAGI-2-preview在AA榜单的排名如何?
MAGI-2-preview在AA视频生成榜单排名第六,仅用6B激活参数就接近第一梯队。
MAGI-2-preview采用什么架构?为什么选择MoE?
MAGI-2-preview采用MoE(混合专家)架构,总参数114B,但每次推理只激活约6B参数。选择MoE是为了在扩大模型容量的同时控制计算成本,解决视频生成中模型更大、视频更长、成本可承受的“不可能三角”问题。
MAGI-2-preview如何解决视频MoE的通信瓶颈?
Sand.ai自研了MagiMoE kernel库和Head Parallel并行策略。Head Parallel在路由前按head分配计算,设备间传输形状固定的head表示,通信量不随激活专家数波动,从而解决了长序列下的通信瓶颈。
MAGI-2-preview的数据处理策略有何不同?
MAGI-2-preview的数据策略从“删减”转向“组织”,扩大有效数据规模,保留广度,通过精准标注组织数据,让模型学习不同场景、动作、声音的对应关系。预训练覆盖完整数据分布,后训练处理偏好对齐、可控性等。
MAGI-2-preview的开源对行业有什么影响?
开源千亿级视频MoE模型改变了行业游戏规则:研究者首次能解剖千亿级视频MoE,企业可私有化部署和行业微调,尤其对数据敏感的金融、医疗等行业有利。同时,开闭源竞争维度被重新定义,开源模型在效果上逼近闭源,可能促使行业走向类似语言模型的两条路线。
MAGI-2-preview的团队背景是什么?
Sand.ai创始人曹越是清华大学特等奖学金获得者、Swin Transformer共同一作,曾联合创办光年之外,并在智源研究院负责多模态与视觉研究。团队技术基因强,注重基础模型和底层infra。创新工场董事长李开复曾称其为“AI视频生成界的DeepSeek”。