这些VLM竟都是盲人?GPT-4o、Sonnet-3.5相继败于「视力」测试

这些VLM竟都是盲人?GPT-4o、Sonnet-3.5相继败于「视力」测试

💡 原文中文,约5500字,阅读约需13分钟。
📝

内容提要

本文讨论了视觉语言模型(VLMs)在视觉测试中的表现,发现其在判断线条交点、识别被红圈圈出的字母、计算图形重叠等任务中表现不佳。文章指出VLMs的视觉能力可能与推理能力和对图像内容的理解方式有关,并建议对其视觉理解和推理能力进行深入研究。

🔎

延伸解读

测试设计:避开数据泄露的“视力表”

为了避免模型从训练数据中“背答案”,研究者没有使用现有基准,而是生成了全新的几何图形和字母识别任务。这些任务几乎不需要世界知识,只依赖对图像细节的感知。例如,数线条交点、判断圆的位置关系、识别被红圈遮挡的字母等。这种设计能更纯粹地检验视觉能力,减少语言先验的干扰。

关键发现:高准确率下的视觉短板

尽管这些VLM在ChartQA等基准上得分很高,但在简单视觉任务中却表现不佳。例如,数线条交点最佳准确率仅77.33%,判断圆位置关系无一完美,识别被遮挡字母时准确率甚至低于随机猜测。这表明模型可能依赖整体趋势或文本线索,而非真正“看清”细节。

模型偏见:奥运五环与空表格的陷阱

测试揭示了VLM的明显偏见:当数圆形时,Gemini-1.5在98.95%的试验中预测为“5”,即使实际数量不同,这可能是训练数据中“奥运五环”的强烈先验。类似地,在数空表格行列时,模型常出现1-2格偏差,而填入文字后准确率显著提升,说明模型不擅长处理缺乏语义信息的纯视觉结构。

争议与反思:是视力问题还是推理缺陷?

有观点认为,将VLM的失败归为“近视”并不准确,因为提高图像分辨率并不能改善其在数交点或空表格上的表现。更可能的原因是模型缺乏对视觉信息的深入推理能力,而非单纯的感知模糊。因此,未来研究需区分视觉编码与推理逻辑的贡献,而非仅关注图像处理。

❓

Q&A

视觉语言模型(VLMs)在视觉测试中的表现如何?

VLMs在视觉测试中表现不佳,尤其在判断线条交点和识别被红圈圈出的字母等任务上,准确率普遍低于预期。

VLMs的视觉能力与哪些因素有关?

VLMs的视觉能力与其推理能力和对图像内容的理解方式有关。

研究者如何测试VLMs的视觉能力?

研究者设计了一套新的视力测试,测试VLMs在判断几何图形之间关系等任务中的表现。

在数线条交点的测试中,VLMs的表现如何?

在数线条交点的测试中,所有VLMs的表现都不佳,最佳准确率仅为77.33%。

VLMs在识别被红圈圈出的字母时的表现如何?

VLMs在识别被红圈圈出的字母时表现差,尤其在字母被遮挡时,准确率普遍低于随机猜测。

VLMs在计算表格行列数时的表现如何?

VLMs在计数表格的行列数时表现不佳,通常存在1-2格的偏差,尤其在空表格中表现更差。

🏷️

标签

➡️

继续阅读