内容提要
智象未来发布首个原生全模态视频生成模型HD-V1,支持文本、图片、视频输入,可直出5–20秒1080p视频,在Artificial Analysis图生视频榜列全球第四、Arena.ai列第八。模型强化意图理解、物理规律、叙事规划与音画同步,并完成C+轮融资,形成图像、视频、3D交互与具身模型闭环。
延伸解读
物理规律导向:从“画得像”到“动得对”
HD-V1强调物理规律理解,旨在解决视频生成中常见的物理不合理问题。文章通过对比demo展示,在红线受力、苹果抛接等场景中,HD-V1能生成更符合真实物理规律的画面,如张力形变、动作节奏自然。这反映出视频生成模型正从追求单帧画质转向对真实世界动态规律的建模,物理合理性成为衡量模型能力的重要维度。
原生全模态架构:音画同步的技术路径
针对AI视频音画不同步的普遍问题,HD-V1采用原生全模态架构,对文本、视频、音频进行联合建模,而非后期拼接。文章指出,这种架构让声音与画面在同一生成过程中相互约束,实现口型、环境声与动作的同步。这为行业提供了音画一体化生成的新思路,但实际效果仍需更多场景验证。
内容驱动时长:叙事节奏的自主规划
多数视频模型按固定提示词时长生成内容,可能导致叙事拖沓或慢放填充。HD-V1将时长决策交还给内容本身,根据事件逻辑和动作周期自行规划生成时长。文章以苹果抛接为例,HD-V1生成的节奏自然,而对比模型则出现无意义等待或慢放。这一能力有助于提升视频叙事的连贯性和真实感。
双榜排名与融资:技术路线获初步认可
HD-V1在Artificial Analysis图生视频榜(含音频)排名全球第四,在Arena.ai图生视频榜排名第八。同时,智象未来完成C+轮融资,投资方包括新微资本、交子资本、工银资本。这些进展表明其原生全模态技术路线和世界模型布局获得了一定市场认可,但榜单排名和融资并不直接等同于产品成熟度,实际应用表现仍需观察。
Q&A
智象未来发布的HD-V1是什么模型?
HD-V1是智象未来发布的首个原生全模态视频生成模型,支持文本、图片、视频等多种模态输入,可一键直出5–20秒1080p高保真视频。
HD-V1在哪些国际评测榜单中取得了什么名次?
HD-V1在Artificial Analysis图生视频榜(含音频)中排名全球第四,在Arena.ai图生视频盲测榜中排名第八。
HD-V1如何解决视频生成中的物理规律问题?
HD-V1将物理规律(如重力、碰撞、惯性、光影衰减、空间连续性)写入视频模型的叙事中,作为画面生成的底层逻辑,从而提升真实质感。
HD-V1在音画同步方面有什么技术突破?
HD-V1采用原生全模态架构,对文本、视频、音频信号进行联合建模,使三者相互约束对齐,实现音画同步与叙事连贯。
HD-V1如何决定视频生成时长?
HD-V1将时长决策交还给内容本身,根据事件展开逻辑、动作完成周期和叙事推进节奏自行规划生成时长,而非固定提示词时长。
智象未来完成C+轮融资的投资方有哪些?
智象未来C+轮融资的投资方包括新微资本、交子资本和工银资本。
智象未来的原生全模态世界模型矩阵包括哪些模型?
包括图像生成模型HiDream-O1-Image系列、视频生成模型HiDream-O1-Video-1.0、交互式世界模型HiDream-O1-World和具身世界模型HiDream-O1-Embodied。