FollowBench:用于大型语言模型的多级细粒度约束追踪基准

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

VisIT-Bench是一个用于评估面向实际应用的指令跟随视觉语言模型的基准测试。该基准测试收集了70个指令家族,数据集包含592个测试查询。VisIT-Bench对参与者是动态的,实践者只需在项目网站上提交其模型的响应。

🏷️

标签

➡️

继续阅读