基于视觉语言模型的字幕评估方法及其视觉上下文提取

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

ViECap是一种可转移的解码模型,通过实体感知解码生成不同场景的描述。它能够在跨域场景转移中保持性能,并在跨域字幕生成方面达到最新水平。

🏷️

标签

➡️

继续阅读