当一篇论文说“AI Agent还不会做研究”,它到底测到了什么?

当一篇论文说“AI Agent还不会做研究”,它到底测到了什么?

💡 原文中文,约4700字,阅读约需12分钟。
📝

内容提要

最近我看到一项很有意思的实验。 研究者找来几个真实、并且还没有公开答案的AI研究课题,让Agent自己查资料、写代码、跑实验、分析结果。他们给了Agent几天时间和相当可观的算力预算,最后再让真正做过这些课题的研究者评价Agent的成果。 结果不太好。Agent没有产出达到论文标准的研究成果。 研究者还分析了大量运行日志,发现Agent有不少问题:一次实验结果不好,它就过早放弃整个方向;不会...

🏷️

标签

➡️

继续阅读