内容提要
本文指出通用人工智能(AGI)已实际到来,以长时程智能体为代表,它们能自主推理、迭代并完成复杂任务,如招聘或编程。2026年将是其关键年,性能呈指数增长,预计未来可完成需人类专家数天至数年的工作。对创业者而言,AI应用将从“对话者”变为“执行者”,需关注如何产品化并销售这些智能体完成的工作。
延伸解读
功能定义:AGI 的实用主义视角
文章明确回避了哲学层面的 AGI 定义,转而提出一个功能性的标准:“能自己把事情搞清楚”。这包括三个要素:预训练知识、推理时计算和长时程智能体的迭代能力。对读者而言,这意味着判断 AI 是否接近 AGI,不应纠结于理论,而应看它能否在真实任务中自主导航、试错并达成目标。
长时程智能体的能力跃迁
文章以招聘为例,展示了智能体如何自主完成从搜索、筛选到联系候选人的完整流程,耗时仅 31 分钟。这标志着 AI 从“对话者”向“执行者”的转变。尽管智能体仍会犯错,但其能力正以指数级增长(每 7 个月翻倍),预计到 2028 年可完成人类专家一天的工作量。
创业者的新挑战:从产品到销售
对创业者而言,AI 应用的核心不再是对话交互,而是如何将智能体完成的工作产品化并销售。文章提出一系列关键问题:哪些任务需要持久注意力?如何优化智能体的“agent harness”?如何按价值定价?这要求创业者从“构建聊天机器人”转向“构建并销售数字员工”。
Q&A
什么是AGI?
根据文章,AGI(通用人工智能)是一种能够自主推理、迭代并完成复杂任务的能力,即“能够把事情弄清楚”。它具备三个要素:预训练知识、推理能力和长时程迭代能力。
为什么说2026年是AGI的关键年?
因为长时程智能体(如Claude Code)在最近几周跨越了能力门槛,它们能自主工作数小时,不断试错并调整策略。这些智能体在功能上等同于AGI,而2026年将是它们大规模应用的一年。
长时程智能体有哪些实际应用案例?
文章提到多个领域的应用:OpenEvidence的Deep Consult作为医学专家,Harvey的代理作为律师助理,XBOW作为渗透测试员,Traversal的代理作为SRE,Day AI作为BDR/SE/RevOps负责人,Juicebox作为招聘人员,Harmonic的Aristotle作为数学家,Ricursive的代理作为芯片设计师,以及GPT-5.2和Claude作为AI研究员。
长时程智能体的性能提升速度有多快?
根据METR的追踪,长时程智能体的性能呈指数增长,大约每7个月翻一番。预计到2028年能完成需要人类专家一天的任务,到2034年能完成一年的任务,到2037年能完成一个世纪的任务。
长时程智能体是如何实现长时间自主工作的?
主要通过两种技术方法:强化学习和智能体框架。强化学习在训练过程中让模型保持更长时间的专注;智能体框架则设计特定的脚手架来弥补模型的已知局限,如记忆交接和压缩。
长时程智能体对创业者有什么启示?
创业者应关注如何将AI应用从“对话者”转变为“执行者”,思考如何将智能体完成的工作产品化并销售。需要关注智能体的可靠性、反馈循环,以及如何按价值和结果定价。
长时程智能体目前存在哪些局限性?
它们仍然会失败,可能产生幻觉、丢失上下文,有时会自信地走向错误方向。但这些问题正在被逐步修复,整体趋势是向好的。