GPT-4o能拼好乐高吗?首个多步空间推理评测基准:闭源模型领跑
内容提要
上海AI实验室推出LEGO-Puzzles基准,评估多模态大模型的多步空间推理能力。研究表明,闭源模型如GPT-4o优于开源模型,但仍远不及人类。复杂空间任务中,模型的推理能力显著下降,尤其在多步推理方面。
关键要点
-
上海AI实验室推出LEGO-Puzzles基准,评估多模态大模型的多步空间推理能力。
-
LEGO-Puzzles基准利用乐高拼搭的结构规则性和空间变化可控性,构建了1100+任务样本。
-
闭源模型如GPT-4o在多步空间推理任务中表现优于开源模型,但仍远不及人类。
-
人类在LEGO-Puzzles-Lite子集中的平均准确率为93.6%,而GPT-4o仅为59.1%。
-
多步推理任务中,模型与人类之间的差距显著,GPT-4o在多步推理中表现不佳。
-
LEGO-Puzzles还评估了视觉生成能力,结果显示大多数模型在结构还原方面存在不足。
-
引入Next-k-Step实验,发现大多数模型在多步推理时存在推理衰减问题。
-
LEGO-Puzzles为评估多模态大模型在复杂空间推理任务中的能力提供了新的基准和测评路径。
延伸解读
多步推理的挑战
LEGO-Puzzles基准揭示了多模态大模型在多步推理任务中的显著不足。尽管GPT-4o在单步推理中表现尚可,但在多步推理时准确率急剧下降,显示出模型在处理复杂逻辑时的脆弱性。这一现象提示研究者在设计更复杂的推理任务时需谨慎,避免过度依赖现有模型的能力。
闭源与开源模型的对比
评测结果显示,闭源模型如GPT-4o在多步空间推理任务中明显优于开源模型。这一差距不仅反映了技术的成熟度,也可能影响未来模型的开发方向。开源模型在空间推理方面的短板,提示开发者需加强对三维结构理解和多步推理能力的研究,以缩小与闭源模型的差距。
人类与模型的认知差距
实验表明,人类在LEGO-Puzzles-Lite子集中的表现远超模型,平均准确率达到93.6%。这一结果强调了当前多模态大模型在空间推理能力上的局限性,尤其是在复杂任务中。未来的研究应关注如何提升模型的推理能力,以更好地模拟人类的认知过程。
延伸问答
LEGO-Puzzles基准的主要目的是什么?
LEGO-Puzzles基准旨在评估多模态大模型在多步空间推理任务中的能力。
GPT-4o在LEGO-Puzzles基准中的表现如何?
GPT-4o在LEGO-Puzzles基准中以57.7%的平均准确率位居榜首,但仍远不及人类的93.6%。
LEGO-Puzzles基准是如何构建的?
LEGO-Puzzles基准通过收集开源LEGO项目源文件,利用Bricklink软件生成多视角图像,并自动生成任务样本。
闭源模型与开源模型在多步空间推理任务中的表现有何不同?
闭源模型普遍优于开源模型,GPT-4o的表现明显高于大多数开源模型,后者在某些任务中甚至准确率为0。
多步推理任务中模型的表现为何会下降?
随着推理步骤的增加,模型的准确率显著下降,显示出推理衰减问题,尤其在k>2时表现不佳。
LEGO-Puzzles基准如何评估视觉生成能力?
LEGO-Puzzles基准通过设计图像生成任务,评估模型在生成目标结构图像时的准确性和指令遵循能力。