Show me《指环王》!卡帕西强推大模型评测新基准

Show me《指环王》!卡帕西强推大模型评测新基准

💡 原文中文,约4500字,阅读约需11分钟。
📝

内容提要

卡帕西用《指环王》开头测试大模型,让Opus 5通过Three.js生成3D中土世界,耗时2小时、百万token。此举取代“鹈鹕骑自行车”SVG测试,成为新基准,考验模型空间理解与复杂项目能力。网友创作多样,但模型仍难真正理解视频或游戏,引发关于空间推理本质的讨论。

🔎

延伸解读

从“画图”到“搭世界”:测试难度的跃升

“鹈鹕骑自行车”SVG测试只考察模型的一次性输出,而《指环王》基准要求模型规划复杂项目、连续工作数小时,并在数千行代码中反复检查修正。这种转变反映了业界对模型能力评估的新方向:不再满足于单张图片的正确性,而是看重模型对整体世界的理解与构建能力。

空间推理的本质之争

有观点认为,生成3D世界需要模型理解前后、内外、远近等空间关系,这是不同于文字处理的能力;但也有观点认为,模型处理“石头旁边”和“数组里面”可能都是同一件事——根据上下文生成Token并推理。若后者成立,则Opus 5展示的并非突现的空间能力,而是通用推理向三维世界的自然延伸。

成本与价值的权衡

反对者指出,一次测试消耗百万Token和两小时,成本高昂且结果不易比较,质疑Three.js能否衡量综合能力。支持者则反驳,将抽象文学文本转化为3D动画,需同时处理空间、物理、图形学等复杂问题,5500行代码足以证明其价值。这一争论凸显了新基准在实用性与严谨性之间的平衡难题。

AI生成内容的未来形态

卡帕西设想将程序化3D与视频生成结合:先用代码确定分镜和骨架,再交给视频模型补全纹理光影。网友已实现用AI生成可交互的3D世界和演唱会。这引发思考:若通用模型能自行调用API完成画面和声音,用户是否还需专门的视频生成产品?实时3D内容的门槛正在降低,但成熟度仍待检验。

Q&A

卡帕西提出的新的大模型测试基准是什么?

卡帕西提出用《指环王》开头作为新的大模型测试基准,让模型用Three.js生成3D中土世界,取代之前的“鹈鹕骑自行车”SVG测试。

为什么用《指环王》测试取代“鹈鹕骑自行车”测试?

因为“鹈鹕骑自行车”测试只考察模型的一次性输出,无法测试模型规划复杂项目、连续工作并修正错误的能力。而《指环王》测试需要模型理解文字并构建整个3D世界,更能考察空间理解和复杂项目能力。

Opus 5在生成《指环王》3D世界时消耗了多少资源?

Opus 5消耗了100万token、2小时时间和5500行代码来生成《指环王》开头的3D世界。

卡帕西认为当前大模型在生成3D世界时存在什么短板?

卡帕西指出,Opus 5无法真正“进入”自己生成的世界,只能通过截图检查问题,暴露了当前大模型不能真正看懂视频或亲自玩自己做的游戏的短板。

网友用《指环王》测试创作了哪些有趣的项目?

网友创作了多个项目,包括用Claude启动的“Earth Online”项目搭建旧金山滨水区、用Fable 5和GPT-5.6 Sol搭建纽约市3D模型并接入实时数据、用Three.js生成Kanye West虚拟演唱会,以及用Opus 5和Three.js制作可交互的游戏版本。

关于“空间推理”的本质,网友有哪些不同观点?

一种观点认为空间推理需要模型理解前后、内外、远近等空间关系;另一种观点认为模型处理文字和代码时可能使用相同的推理机制,空间能力可能是通用推理能力的延伸。

卡帕西对程序化3D和视频生成的关系持什么看法?

卡帕西认为程序化3D和视频生成不是二选一,可以结合使用:程序化代码负责分镜和控制,视频模型负责补上纹理、光影和细节,提升画质。

🏷️

标签

➡️

继续阅读