内容提要
本文讨论了视觉语言模型(VLMs)在视觉测试中的表现,发现其在判断线条交点、识别被红圈圈出的字母、计算图形重叠等任务中表现不佳。文章指出VLMs的视觉能力可能与推理能力和对图像内容的理解方式有关,并建议对其视觉理解和推理能力进行深入研究。
延伸解读
测试设计:避开数据泄露的“视力表”
为了避免模型从训练数据中“背答案”,研究者没有使用现有基准,而是生成了全新的几何图形和字母识别任务。这些任务几乎不需要世界知识,只依赖对图像细节的感知。例如,数线条交点、判断圆的位置关系、识别被红圈遮挡的字母等。这种设计能更纯粹地检验视觉能力,减少语言先验的干扰。
关键发现:高准确率下的视觉短板
尽管这些VLM在ChartQA等基准上得分很高,但在简单视觉任务中却表现不佳。例如,数线条交点最佳准确率仅77.33%,判断圆位置关系无一完美,识别被遮挡字母时准确率甚至低于随机猜测。这表明模型可能依赖整体趋势或文本线索,而非真正“看清”细节。
模型偏见:奥运五环与空表格的陷阱
测试揭示了VLM的明显偏见:当数圆形时,Gemini-1.5在98.95%的试验中预测为“5”,即使实际数量不同,这可能是训练数据中“奥运五环”的强烈先验。类似地,在数空表格行列时,模型常出现1-2格偏差,而填入文字后准确率显著提升,说明模型不擅长处理缺乏语义信息的纯视觉结构。
争议与反思:是视力问题还是推理缺陷?
有观点认为,将VLM的失败归为“近视”并不准确,因为提高图像分辨率并不能改善其在数交点或空表格上的表现。更可能的原因是模型缺乏对视觉信息的深入推理能力,而非单纯的感知模糊。因此,未来研究需区分视觉编码与推理逻辑的贡献,而非仅关注图像处理。
Q&A
视觉语言模型(VLMs)在视觉测试中的表现如何?
VLMs在视觉测试中表现不佳,尤其在判断线条交点和识别被红圈圈出的字母等任务上,准确率普遍低于预期。
VLMs的视觉能力与哪些因素有关?
VLMs的视觉能力与其推理能力和对图像内容的理解方式有关。
研究者如何测试VLMs的视觉能力?
研究者设计了一套新的视力测试,测试VLMs在判断几何图形之间关系等任务中的表现。
在数线条交点的测试中,VLMs的表现如何?
在数线条交点的测试中,所有VLMs的表现都不佳,最佳准确率仅为77.33%。
VLMs在识别被红圈圈出的字母时的表现如何?
VLMs在识别被红圈圈出的字母时表现差,尤其在字母被遮挡时,准确率普遍低于随机猜测。
VLMs在计算表格行列数时的表现如何?
VLMs在计数表格的行列数时表现不佳,通常存在1-2格的偏差,尤其在空表格中表现更差。