内容提要
MiniMax发布新一代开源视频模型H3,具备全模态精准控制和AI原生后期能力,支持文字、图片、视频、音频混合输入。测试显示,H3能高效生成产品宣传片、品牌片、广告和游戏UI视频,精准替换物体、背景和镜头角度,并自动完成转场、配乐和文字渲染。它降低了视频制作门槛,让非专业用户也能快速产出完整Demo,同时开源特性帮助企业自主搭建视频生产能力,推动AI视频进入商业生产。
延伸解读
从“生成素材”到“交付成片”的转变
文章指出,传统AI视频工作流中,模型只负责生成素材,后期剪辑、配乐、字幕等仍需人工完成。MiniMax H3通过全模态输入和AI原生后期能力,将生成、编辑、包装整合在同一模型中,直接输出接近成片的视频。这降低了非专业用户的制作门槛,也改变了专业团队的工作流程,使视频制作更高效。
精准编辑能力:解决“不可控”痛点
H3支持对已生成视频进行局部修改,如替换物体、背景、人物,甚至调整镜头角度,且保持其他元素一致。文章测试显示,它能精准执行“将小提琴换成二胡”或“改变摄像机角度”等指令,弥补了多数视频生成模型无法定点修改的空白。这对需要反复修改的商业视频制作尤为重要。
开源带来的成本与自主性优势
MiniMax H3的开源特性允许企业自主搭建视频生成能力,避免依赖高价Token采购,降低长期使用成本。文章强调,开源使团队能按需调整算力和工作流,实现更可持续、自主可控的生产方式。这为广告、电商、游戏等团队提供了新的选择,推动AI视频进入商业生产。
Q&A
MiniMax H3 是什么?它有哪些核心能力?
MiniMax H3 是 MiniMax 发布的新一代开源视频模型,具备全模态精准控制和 AI 原生后期能力。它支持文字、图片、视频、音频混合输入,能精准替换物体、背景和镜头角度,并自动完成转场、配乐和文字渲染,降低视频制作门槛。
MiniMax H3 支持哪些输入类型?最多能输入多少文件?
MiniMax H3 支持文字、图片、视频和音频混合输入,一次最多使用 9 张图片、3 段视频和 3 段音频,混合文件上限为 12 个。
MiniMax H3 在视频编辑方面有哪些具体能力?
H3 可以精准替换物体、背景和镜头角度,例如将小提琴换成二胡、将背景从音乐厅改为草原或海边,还能调整摄像机角度。它也能在复杂画面中分别处理不同对象的指令,如指定左边的人换衣服、右边的人变成狗。
MiniMax H3 在生成商业视频(如广告、品牌片)方面表现如何?
H3 能高效生成产品宣传片、品牌片、广告和游戏 UI 视频。测试中,它能根据产品截图生成介绍视频,根据详细提示词生成品牌片,并自动添加转场、配乐和文字渲染,结果接近成片,满足商业交付需求。
MiniMax H3 相比其他视频模型(如 Gemini Omni)有什么优势?
在 Artificial Analysis 的全球视频编辑榜上,MiniMax H3 发布后超过 Gemini Omni 等模型,拿下第一。它具备全模态精准控制和 AI 原生后期能力,能自动完成后期包装,且开源,降低使用成本,让团队能自主搭建视频生产能力。
MiniMax H3 的开源特性对企业和创作者有什么意义?
开源让企业客户和创作者能以更低成本使用模型,并允许他们围绕模型搭建自己的视频生产能力,按需调整算力,实现工作流和业务逻辑的试错,避免依赖高价 Token 采购,走上更可持续、自主可控的发展道路。
MiniMax H3 在文字渲染方面有什么不足?
H3 在主要文字渲染上准确,但遇到较小和密集的文本时,仍会偶发乱码问题。上传图片的画质会影响生成准确性,清晰截图能降低错误率。
MiniMax H3 如何降低视频制作门槛?
H3 支持混合输入和自动后期,用户无需专业剪辑技能,只需提供图片、视频或文字描述,即可生成包含转场、配乐和文字渲染的完整视频。它还能理解分镜图并重新布局,让非专业用户也能快速产出 Demo 和提案素材。