本文调研实时多模态视频模型,提出L0-L3能力分级,区分“支持视频”的四种层次。核心在于“可流式性”插入的层级:客户端采帧、分块编码、共享时间轴、显式触发、异步思考、模态专家或原生AV2AV。文章分析Qwen3.5-Omni、MiniCPM-o、ROMA、DuplexOmni、ELLSA、Wan-Streamer等方案,强调真正的实时取决于状态增量更新、说话时机可学习及音视频因果生成,并给出选型建议。
完成下面两步后,将自动完成登录并继续当前操作。