内容提要
PhiloLabs使用AI编码代理Claude Fable 5.1,结合地理数据与照片,重建旧金山联合广场的3D场景,并生成可在浏览器中运行的版本。代理被分配处理建筑、纹理等任务,并通过Playwright截图与真实照片对比,发现视觉错误。实验耗资约33美元、800万token,但代理审查可能遗漏问题,复杂应用仍需人工验证。
延伸解读
成本与token消耗的启示
实验耗资约33美元、800万token,看似低廉,但这是通过并行子代理和缓存上下文实现的。对于更复杂的应用,token消耗和成本可能显著上升。开发者不应仅以此次成本为基准,需评估自身项目的规模与复杂度。
视觉验证的局限
使用Playwright截图对比真实照片,能发现比例错误、位置偏差等视觉问题,但无法捕捉代码逻辑错误或用户交互触发的问题。正如Spline重建编辑器时,截图只能反映界面的一部分,深层缺陷可能被遗漏。因此,人工审查和功能测试仍不可或缺。
数据不完整带来的挑战
地理数据提供位置信息,但缺乏外观细节;照片仅覆盖特定角度。当数据源不完整时,代理需自行推断,而审查代理可能忽略相同错误。这提醒我们,AI生成内容的质量受限于输入数据的质量,不完整数据可能导致错误决策。
Q&A
PhiloLabs 用 AI 编码代理重建了旧金山的哪个地点?
PhiloLabs 用 AI 编码代理重建了旧金山联合广场的 3D 场景。
这次 AI 重建联合广场的实验花费了多少成本?
实验大约使用了 800 万 token,API 调用成本约 33 美元。
PhiloLabs 如何检查 AI 代理生成的 3D 场景是否存在视觉错误?
他们使用 Playwright 在 34 个预定相机位置截图,并与真实联合广场的照片对比,生成了 147 张对比表,以便发现技术上正确但视觉上错误的问题。
AI 代理在重建过程中使用了哪些数据源?
主要使用了 OpenStreetMap 和 USGS 高程数据等开放地理数据,以及真实地点的参考照片。
为什么仅靠代码测试不足以发现 3D 场景中的问题?
因为代码测试可以检查建筑坐标等客观属性,但很难判断街道是否看起来像联合广场,视觉上的错误(如建筑比例不对或店面位置错误)需要人工或截图对比才能发现。
PhiloLabs 如何控制成本,使 800 万 token 的消耗仅花费约 33 美元?
他们通过将任务分配给多个子代理并行运行,并复用缓存上下文,而不是让单个代理从头到尾处理整个项目,从而降低了 API 调用成本。
AI 代理在重建联合广场时遇到了哪些挑战?
挑战包括地理数据只提供建筑位置而不显示外观,照片只能捕捉特定角度的部分,导致代理在信息不完整时需自行判断,且审查代理可能遗漏与原始代理相同的问题。
PhiloLabs 的实验对复杂应用开发有何启示?
实验表明,截图对比在简单场景中有效,但对于复杂应用(如 3D 编辑器),截图无法捕捉代码深层问题或用户实际使用触发的问题,因此复杂应用仍需人工验证。