内容提要
Vivix发布实时交互多模态模型A1,支持用户与虚拟角色实时视频通话,角色能行动、互动并持续响应。配套W1模型可改变剧情走向。A1通过MJD蒸馏、原生NVFP4和VMI基础设施,实现近30B参数在消费级GPU上实时推理,延迟低于0.6秒,单卡吞吐超10000 video tokens/s,已开放内测。
延伸解读
技术突破:从8步到2步的实时推理
A1模型通过多维联合蒸馏(MJD)将视频扩散从8步压缩到2步,同时保持画质和运动表现。这一突破使得近30B参数的模型能在消费级GPU上实时运行,延迟低于0.6秒。相比传统方法,A1在保证质量的同时大幅提升了推理效率,为实时交互提供了可能。
架构创新:原生流式统一多模态
A1采用原生流式架构,统一了多模态参考、实时交互和流式生成,避免了传统流水线中信息丢失和延迟问题。通过直接建模语言、声学、视觉等信号,A1能持续聆听并响应环境变化,实现更自然的交互。这种设计解决了长期生成中的一致性问题,是区别于传统数字人的关键。
基础设施优化:VMI的三大策略
VMI通过解耦Encoder与Decoder、采用原生NVFP4量化、以及计算-通信-内存协同调度,解决了实时生成的瓶颈。这些优化使得模型在消费级硬件上实现单卡吞吐超10000 video tokens/s,PCIe带宽利用率达88%以上。这为大规模实时交互应用提供了可行的部署方案。
Q&A
Vivix发布的A1模型是什么?
A1是Vivix发布的实时交互多模态模型,支持用户与虚拟角色进行实时视频通话,角色能够行动、互动并持续响应。
A1模型与传统的数字人和视频生成模型有什么不同?
A1模型让屏幕里的角色真正拥有身体,能够行动、转身、改变姿态,并与环境互动,而传统数字人和视频生成模型通常只是对着镜头说话。
A1模型是如何实现低延迟实时推理的?
A1通过MJD蒸馏、原生NVFP4和VMI基础设施,实现了近30B参数在消费级GPU上的实时推理,延迟低于0.6秒,单卡吞吐超过10000 video tokens/s。
A1模型在模型层面主要做了哪三件事?
A1在模型层面主要做了三件事:参考条件持续生效、新的交互随时插入、音频和视频持续生成。
A1模型是如何解决流式生成中的一致性问题?
A1通过因果时序建模和流式状态维护,将图片、视频、声音、交互历史和已生成内容写入持续状态,并利用局部连续性先验和全局序列先验来维持角色身份、场景和物体关系。
A1模型与传统的数字人流水线有什么不同?
传统数字人使用ASR、LLM、TTS等串行流水线,而A1直接建模语言语义、声学特征、非语言声音、环境事件、手势和动态视觉信号,实现持续聆听和事件触发响应。
MJD蒸馏技术是什么?它有什么作用?
MJD是多维联合蒸馏,将8-Step视频扩散模型压缩到2-Step,同时保持接近8-Step的画质、指令遵循、运动表现和长时稳定性。
VMI基础设施是如何优化推理性能的?
VMI通过Encoder与Decoder解耦、prefill/decode分离、原生NVFP4训推协同以及计算-通信-内存协同调度,实现了单卡吞吐超过10000 video tokens/s,PCIe带宽利用率达88%以上。
A1模型如何实现消费级GPU上的部署?
A1通过原生NVFP4量化(4-bit)和低精度感知蒸馏,使模型适应4-bit数值分布,从而降低显存占用和计算量,实现近30B参数在消费级GPU上的实时推理。
W1模型的作用是什么?
W1模型让用户能够介入故事,改变人物的选择、行动和剧情走向,使角色背后的世界更加丰富。