阿里云Wan 3.0视频模型已上线AI网关,支持文生视频、图生视频、首尾帧及参考生成,输出最长30秒、30fps、最高1080p并含音频。提供轮询、异步任务及Webhook三种生成方式,支持图像、视频、音频参考,简化了多模型流程。
秘塔AI上线MiniMax H3视频模型,用户无需部署或配置环境,打开网页即可使用。生成视频价格低至0.09元/秒,5秒视频不到五毛钱,2K版本也仅0.15元/秒。该模型支持文生视频、图生视频等功能,大幅降低了创作门槛和试错成本,让普通创作者能轻松将创意转化为视频。
视频模型通过观察人类视频,不仅学习动作,还吸收了人类的“下意识选择”和偏见,形成一套“潜规则决策系统”。在电车难题测试中,模型倾向于逃避选择,如预测火车故障而非撞人,反映出“决策规避”和统计平均行为。这种偏见若用于行动模型,可能导致AI过度保守或行为偏差,需正视其放大效应,避免自动化灾难。
本文调研实时多模态视频模型,提出L0-L3能力分级,区分“支持视频”的四种层次。核心在于“可流式性”插入的层级:客户端采帧、分块编码、共享时间轴、显式触发、异步思考、模态专家或原生AV2AV。文章分析Qwen3.5-Omni、MiniCPM-o、ROMA、DuplexOmni、ELLSA、Wan-Streamer等方案,强调真正的实时取决于状态增量更新、说话时机可学习及音视频因果生成,并给出选型建议。
MiniMax发布开源视频模型H3,支持端到端生成带特效、字幕、转场的完整视频,默认2K分辨率,文字渲染和音频驱动表现优秀,价格低于主流模型。模型采用全模态输入和Omni架构,提升可控性,并开源以支持私有部署,被视为视频生成进入商用阶段的标志。
Xmax AI发布了实时交互视频模型X2.0,具备实时换装和角色变换功能,用户可与虚拟角色深度互动。该模型通过毫秒级响应和多种交互方式提升用户体验,适用于电商和直播等领域。X2.0的API将推动视频行业变革,降低创作门槛,重塑人机交互方式。
本文介绍了如何在Gemini CLI中接入Seedance MCP,使用11个视频模型生成短视频。用户需注册AceData Cloud并获取API Token,通过命令行或手动配置即可使用,示例包括生成舞蹈和美食制作视频。
Gemini CLI 现已支持 Seedance MCP,用户可通过 API Token 调用 11 个视频模型生成短视频,配置简单,支持竖屏 9:16 格式,适合舞蹈和美食制作等场景。
美团开源了LongCat-Video-Avatar 1.5数字人视频模型,提升了唇形同步、稳定性和多人互动能力。通过优化音频特征提取和数据处理,该模型在复杂场景中表现优异,生成效率提高15倍,适用于电商直播和教学等多种场景,推动数字人视频的实际应用。
本文探讨了通过学习长期运动嵌入来高效生成运动的技术。研究表明,利用大规模轨迹获得的运动嵌入,可以更有效地生成长时间的真实运动,以满足文本提示或空间指令的目标。通过压缩运动嵌入并训练条件流匹配模型,生成的运动分布优于现有视频模型和特定任务方法。
谷歌推出Veo 3.1 Lite视频模型,成本低于Veo 3.1 Fast,支持文本和图像转视频,提供灵活的画幅和分辨率。4月7日将降低Veo 3.1 Fast价格,以便更多开发者使用。
国产视频模型SkyReels-V4近期在全球视频大模型排行榜中跃升至第二位,展现出强大的多模态生成能力,支持文本、图像、视频和音频的组合输入,实现精准控制和专业级视频修复,推动视频创作全流程一体化。
Kling 3.0视频模型已在AI Gateway上线,支持从文本和图像生成高质量视频,具备多场景叙事和音频生成等功能,适合专业用户,提供无代码实验平台。
DeepMind提出了“帧链”(CoF)概念,旨在赋予视频模型通用视觉理解能力。Veo 3模型通过简单提示生成视频,展现出感知、建模和操控能力,能够处理多种视觉任务。尽管在特定任务上不及专用模型,但其性能正在快速提升,未来有望成为机器视觉的“通用基础模型”。
Midjourney推出首个视频模型,用户可将图像转换为视频,支持手动和自动模式。视频保持超现实美学,但功能尚显粗糙,分辨率仅为480p,缺乏音效和时间轴编辑。未来将继续开发3D模型和实时系统,旨在构建完整的内容生产体系。
Meta推出V-JEPA 2,这是一种新型视频世界模型,旨在提升机器对物理环境的理解和预测能力。该模型经过两阶段训练,首先自监督预训练超过一百万小时的视频,然后在62小时的机器人数据上微调。V-JEPA 2在机器人操作任务中表现优异,成功率达65%至80%。
文章探讨了语言模型(LLM)与视频模型在学习能力上的差异。尽管视频数据更丰富,LLM却通过简单算法展现出更复杂的认知能力。作者将AI比作“柏拉图洞穴”,指出AI只能模仿人类知识,无法自主探索。未来的目标是让AI能够直接与物理世界互动,突破对人类知识的依赖。
AI初创公司Runway推出了Gen-4视频模型,能够在多个镜头中生成一致的场景和人物。该模型允许用户通过单一参考图像生成角色和物体,提供更好的故事连贯性和控制力。用户只需描述构图,模型便能从多个角度生成一致的输出。
Luma AI 的 Ray2 视频模型已在 Amazon Bedrock 上推出,能够通过文本生成高质量视频,支持多种应用场景,如内容创作和广告。用户可通过 API 轻松生成不同角度和风格的视频。
爱诗科技的PixVerse V3.5视频模型实现接近实时的生成速度,显著提升运动控制和画质,支持多种动画风格,降低影视制作门槛,提供流畅的内容创作体验。
完成下面两步后,将自动完成登录并继续当前操作。