本文介绍“内化视觉思维”(IVT)框架,用于视频推理。IVT在训练时预测未来帧的潜在表征,推理时直接生成答案,无需生成中间图像。相比视觉思维链(Visual CoT),IVT性能相当或更优,且延迟降低5倍以上,表明显式像素生成在推理中并非必需,可提升效率与准确性。
完成下面两步后,将自动完成登录并继续当前操作。