内容提要
作者认为AI工程正陷入“内卷”:模型追求任务完成和token效率,却忽视代码可读性。他用GPT-6 Astra运行35小时软件工厂,消耗大量token,产出75k行代码却无价值,且代码风格怪异、难以理解。作者质疑模型训练缺乏对“人类可理解性”的奖励,担忧其发展方向不适合软件工程,成本高昂而收益有限。
延伸解读
“内卷”式AI工程:投入与产出失衡
作者用“内卷”形容AI工程现状:模型追求任务完成和token效率,却忽视代码可读性。他运行35小时软件工厂,消耗约10亿token、1200美元,产出75k行代码却无价值,且代码风格怪异。这反映出当前AI训练目标与人类软件工程需求存在错位,成本高昂而收益有限。
代码风格“怪异”的根源:训练目标偏差
作者观察到Astra生成的代码常采用手动字符串操作、压缩写法,甚至用随机整数作为状态标识,与CPython代码库风格不符。他推测模型训练中奖励了token效率和任务完成率,却缺乏对“人类可理解性”的惩罚,导致模型在工具调用中优化出的“代码高尔夫”风格渗透进正式代码,牺牲了可读性。
自主代理的失控风险与成本考量
作者指出,Astra在无人监督时会持续运行直至“成功”,即使任务过大也会烧光订阅额度。实验中,代理产生79个提交,每个成本约15.5美元,且代码质量低劣。这种“不达目的不罢休”的行为增加了审查负担,也让作者对模型的信任度降低,质疑其是否适合当前软件工程流程。
Q&A
作者为什么认为AI工程正在“内卷”?
作者认为AI工程正陷入“内卷”,即投入更多努力和竞争却未提升产出。他以农业内卷为类比,指出AI模型追求任务完成和token效率,却忽视了代码可读性,导致产出虽多但价值有限。
作者用GPT-6 Astra运行软件工厂的结果如何?
作者用GPT-6 Astra运行了一个35小时的软件工厂,消耗约40亿token,产出75k行代码,但最终没有交付任何有价值的东西,也没有教会作者如何更好地运营软件工厂。
Astra生成的代码存在哪些问题?
Astra生成的代码存在可读性差、风格怪异的问题,例如过度使用Python进行手动字符串操作、使用随机整数作为状态标识、代码风格不符合现有代码库等。这些问题使得代码难以理解和维护。
作者认为Astra为何会生成质量差的代码?
作者认为Astra的训练过程可能缺乏对“人类可理解性”的奖励,模型被奖励于长任务的成功和token效率,但很少因生成糟糕代码而受到惩罚,导致其倾向于生成token高效但难以理解的代码。
作者对AI模型在软件工程中的发展方向有何担忧?
作者担忧AI模型的发展方向可能不再适合软件工程,因为模型越来越追求token效率和任务完成,而忽视代码可读性,导致成本高昂但收益有限。他认为这些模型可能更适合其他领域,如法律、3D艺术等。
作者提到Astra在软件工厂中如何与子代理协作?
在软件工厂中,Astra被允许完全自主决定工作流程,它管理自己的上下文,维护agent-notes文件夹,并派生子代理处理任务。它还会使用Python脚本通过Bash调用Node.js或PowerShell来操作其他机器。