GPT4Ego: 发挥预训练模型潜力的零样本个人行为识别

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

本文提出了一个新颖的问题,即以自身为中心的动作帧生成。通过视觉指导优化自然语言大型模型(VLLM),以充实的动作描述进行微调,解决了现有数据集缺乏详细注释和无法控制动作状态变化的问题。同时,利用来自VLLM的图像和文本嵌入作为附加条件的LEGO动作帧生成方法也被提出。实验证明,该模型相较于先前的图像操作模型有显著改进。

➡️

继续阅读