该文综述多模态视觉表征与机器人操控研究,通过多任务微调预训练视觉编码器,并利用任务融合解码器改进R3M、MVP、EgoVLP等表示以提升下游操控性能;同时涉及对比学习、概率分布编码、多模态提示与CriticGPT偏好反馈等方法,增强迁移与规划能力。
完成下面两步后,将自动完成登录并继续当前操作。