吴恩达:别光盯着GPT-5,用GPT-4做个智能体可能提前达到GPT-5的效果
内容提要
斯坦福大学教授吴恩达表示,基于GPT-3.5构建的智能体作业流在实际应用中表现优于GPT-4。智能体作业流包括反思、东西运用、规划和多智能体协作四种形式。反思形式通过多次提示LLM来逐步提升输出质量。智能体作业流将推动人工智能的巨大进步。
延伸解读
智能体工作流:小模型也能超越大模型
吴恩达指出,基于GPT-3.5构建的智能体工作流在HumanEval编程基准上准确率可达48%以上,甚至优于GPT-4的零样本提示(67%)。这并非否定大模型的价值,而是强调通过反思、工具使用、规划等迭代流程,可以显著提升输出质量。对于开发者而言,这意味着不必等待下一代模型,利用现有模型配合智能体设计就能提前获得接近GPT-5的效果。
反思模式:让LLM自我批判与改进
反思是智能体工作流中实现速度较快的一种形式。它通过多次提示LLM,让其检查自身输出的正确性、风格和效率,并提出建设性意见,然后基于反馈重写。例如在代码生成中,LLM能发现bug并优化代码。吴恩达推荐了Self-Refine、Reflexion等论文,表明该模式已得到研究验证。对于实践者,这意味着可以低成本地提升生成质量,尤其适合代码、文本等任务。
规划与多智能体协作:潜力与局限
规划让LLM提出并执行多步骤方案,如HuggingGPT示例中组合多个模型完成图像生成与描述。多智能体协作则通过角色分配(如CEO、程序员)和讨论争辩产生更优方案,ChatDev项目展示了其可行性。但吴恩达也指出,这些技术尚不稳定,有时会失败。因此,在实际应用中需保持耐心,并准备应对迭代中的不确定性。
适应新工作流:耐心与快速迭代
吴恩达强调,智能体工作流需要用户改变即时响应的习惯,学会分配任务并等待几分钟甚至几小时。同时,快速的token生成比单纯追求模型质量更重要,因为迭代次数增多可能带来更好结果。这要求我们调整工作方式,接受智能体可能失败并重新规划,从而在长期旅程中逐步提升生产力。
Q&A
吴恩达认为基于哪个模型的智能体作业流表现优于GPT-4?
吴恩达认为基于GPT-3.5构建的智能体作业流表现优于GPT-4。
智能体作业流包含哪些形式?
智能体作业流包括反思、东西运用、规划和多智能体协作四种形式。
反思形式在智能体作业流中有什么作用?
反思形式通过多次提示LLM来逐步提升输出质量,使其能够自我批判并改善输出。
东西运用形式如何增强LLM的能力?
东西运用形式使LLM能够通过网络查找和代码执行来增强其能力。
多智能体协作形式的优势是什么?
多智能体协作形式通过多个智能体的合作与讨论,产生更优的解决方案。
吴恩达对未来AI智能体的看法是什么?
吴恩达认为未来的AI智能体将推动人工智能的巨大进步,并需要用户的耐心和适应新的工作流程。