LLaVA-SpaceSGG: Visual Instruct Tuning for Open-Vocabulary Scene Graph Generation with Enhanced Spatial Relations
原文英文,约100词,阅读约需1分钟。
📝
内容提要
本研究提出了LLaVA-SpaceSGG模型,解决了现有场景图生成模型在开放词汇环境中忽视空间关系的问题。通过增强空间关系建模和利用新数据集进行训练,LLaVA-SpaceSGG在召回率上显著提高,实验结果显示召回率提升8.6%,平均召回率提升28.4%。
🏷️