内容提要
AI大神Karpathy用10美元让模型生成《指环王》3D场景,通过写代码而非画图,暴露了AI视觉自省能力的短板。文章指出,AI擅长代码逻辑但缺乏视觉校验,生成场景粗糙,难以支撑“定制化GTA”的愿景,更多是廉价幻觉和科技圈自我感动。
延伸解读
AI为何选择写代码而非画图?
文章指出,大语言模型本质是文字接龙,在像素空间预测远不如在逻辑空间(代码)中预测稳定。代码有语法规则和坐标系,训练数据充足,因此AI能生成三维场景代码,但直接画图却常出错。这解释了为何AI在视觉生成上笨拙,却在程序化生成上表现较好。
10美元成本的背后:质量与价值的权衡
Karpathy的实验成本约10美元,产出粗糙但可识别的3D场景。文章认为,当成本趋近于零时,质量权重下降,用户更易容忍瑕疵。这种“能用就行”的心态,使AI生成内容成为一次性商品,但也可能降低对作品深度和意义的期待。
视觉自省:AI的致命短板
AI无法直接“看”自己的生成结果,只能通过截图反馈缓慢调整,效率极低且易出错。文章比喻为盲人摸象,指出这是当前AI造物能力的主要瓶颈。缺乏视觉自省,意味着AI难以独立校验和优化输出,限制了其从“技术演示”走向“实用产品”的可能。
定制化世界的距离:从单向输出到互动体验
文章认为,AI生成世界目前是单向输出,缺乏互动性。真正可玩的世界需要低延迟和逻辑一致性,而当前AI生成的代码只能“看起来像世界”,无法“运行起来像世界”。因此,距离“定制版GTA”的愿景仍有巨大鸿沟,核心在于交互和长期内容沉淀。
Q&A
卡帕西用10美元生成《指环王》3D场景的实验具体是怎么做的?
卡帕西让Opus 5模型根据《指环王》第一段文字,花费近两小时生成5500行代码,在浏览器中渲染出袋底洞的3D场景,包括树木、山坡和圆形绿色大门,比尔博·巴金斯还在门口出现后消失。
为什么AI宁愿写代码生成3D场景,也不直接画图?
因为大语言模型本质是文字接龙,擅长在逻辑空间(代码)中预测,代码有语法规则和大量训练数据;而图像生成需要在混乱的像素空间预测,难度更大。因此AI在代码生成上表现更好,但在视觉生成上笨手笨脚。
AI在视觉自省能力上有什么短板?
AI无法直接“看”到自己生成的3D场景,只能通过截图和视觉模块缓慢反馈来调整,效率极低,且经常出现窗户悬浮、树木错位等错误,就像盲人摸象,无法高效审视自己的作品。
卡帕西认为AI生成3D世界的成本和质量如何?
成本约10美元,质量粗糙但可识别,他认为这种例子有趣是因为正常人不会花时间写定制化代码,成本趋近于零时,质量权重下降,人们会容忍瑕疵。
AI生成3D世界距离定制化GTA还有多远?
基础能力已具备,但缺少编排层,且目前是单向输出,无法实现互动,需要极低延迟和逻辑一致性,因此距离可玩的定制化GTA还有很大距离。
网友对卡帕西实验的主要批评是什么?
网友批评实验依赖训练数据复现而非创造,效果粗糙,缺乏可玩性,成本并非真正免费,且AI缺乏物理校验能力,认为噱头大于实质。