烹饪推广挑战
原文中文,约300字,阅读约需1分钟。发表于: 。Overcooked Generalisation Challenge (OGC) 是第一个研究代理人对新伙伴和关卡的零 - shot 合作能力的基准测试。该挑战与最先进的双重课程设计(DCD)方法接口,为训练 Overcooked 中的普适代理人生成自动课程设计,并推动了真实世界人工智能合作中的泛化研究。
该研究使用OmniACT数据集和基准测试评估了代理程序生成可执行计算机任务的能力。结果显示,最强的基线语言模型代理(GPT-4)在测试中表现最好,但与人类能力相比仅达到15%。该基准测试为衡量和评估语言模型代理在自动化计算机任务方面的进展提供了平台,并激励未来研究努力构建大型语言模型和计算机屏幕的视觉基础的多模态模型。