GPT-4o和Sonnet-3.5在视力测试中败北,VLM们竟是“盲人”?
视觉语言模型(VLMs)如GPT-4o、Gemini-1.5Pro等, 已展示了在图像与文本处理上的优异表现,甚至在视觉理解测试中成绩亮眼。 然而,新近研究揭示出,这些AI在本质上并未达到完全模拟人类视觉理解的能力。一份名为“BlindTest”的测试结果显示,这些高级模型在识别基本图形关系(如判定图示中线条交集、图形重叠)等方面,准确率平均仅达56.20%,最高仅73.77%,远低于人类的出色表现。
这一发现呈现了一个关键现象——VLMs的“视”如同近视者,难以精准捕捉并理解图像中细节和精确的空间关系,如判断两个圆是否相交或数数图像中的具体圆圈数量时,普遍存在偏差。特别是,当图像中圆圈数量脱离“5”这个数值时,模型偶有“偏好”,显示其在数量识别上的局限性。
这些发现挑战了公众对VLMs能力的认知,揭示了AI在图像语义理解方面的局限性,并提醒我们人工智能在视觉理解能力方面仍存在显著的待解决问题。