这些VLM竟都是盲人?GPT-4o、Sonnet-3.5相继败于「视力」测试

这些VLM竟都是盲人?GPT-4o、Sonnet-3.5相继败于「视力」测试

💡 原文中文,约5500字,阅读约需13分钟。
📝

内容提要

本文讨论了视觉语言模型(VLMs)在视觉测试中的表现,发现其在判断线条交点、识别被红圈圈出的字母、计算图形重叠等任务中表现不佳。文章指出VLMs的视觉能力可能与推理能力和对图像内容的理解方式有关,并建议对其视觉理解和推理能力进行深入研究。

Q&A

视觉语言模型(VLMs)在视觉测试中的表现如何?

VLMs在视觉测试中表现不佳,尤其在判断线条交点和识别被红圈圈出的字母等任务上,准确率普遍低于预期。

VLMs的视觉能力与哪些因素有关?

VLMs的视觉能力与其推理能力和对图像内容的理解方式有关。

研究者如何测试VLMs的视觉能力?

研究者设计了一套新的视力测试,测试VLMs在判断几何图形之间关系等任务中的表现。

在数线条交点的测试中,VLMs的表现如何?

在数线条交点的测试中,所有VLMs的表现都不佳,最佳准确率仅为77.33%。

VLMs在识别被红圈圈出的字母时的表现如何?

VLMs在识别被红圈圈出的字母时表现差,尤其在字母被遮挡时,准确率普遍低于随机猜测。

VLMs在计算表格行列数时的表现如何?

VLMs在计数表格的行列数时表现不佳,通常存在1-2格的偏差,尤其在空表格中表现更差。

🏷️

标签

➡️

继续阅读