HAIC:通过更好的多模态大语言模型字幕提高人类动作理解和生成
📝
内容提要
本研究针对多模态大语言模型在处理人类动作视频时由于缺乏高质量数据而表现有限的问题,提出了一种两阶段的数据注释流程。通过建立HAICTrain和HAICBench两个数据集,该工作显著提升了人类动作理解能力和文本到视频的生成效果,展示了其在评估和训练中的潜在影响。
🏷️
本研究针对多模态大语言模型在处理人类动作视频时由于缺乏高质量数据而表现有限的问题,提出了一种两阶段的数据注释流程。通过建立HAICTrain和HAICBench两个数据集,该工作显著提升了人类动作理解能力和文本到视频的生成效果,展示了其在评估和训练中的潜在影响。