BALROG:评估智能LLM和VLM游戏推理的基准

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究提出了BALROG基准,用于评估大语言模型和视觉语言模型在复杂动态环境中的智能能力。结果表明,这些模型在简单任务中表现尚可,但在视觉决策等复杂任务中存在明显局限,为未来研究提供了开放的基准。

🏷️

标签

➡️

继续阅读