语言模型代理在 Web 自动化中受到构成性泛化的影响

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

LMA在基本任务上表现优于人类和强化学习代理,但在涉及任务组合的实际应用中,性能仍未得到充分探索。通过引入新的基准CompWoB,展示了LMA在组合任务上的表现下降。设计了新模型HTML-T5++,在MiniWoB上超过人类水平并在CompWoB上取得最佳零样本性能。然而,在改变组合顺序的不同指令组合下,性能进一步下降。与LMA的最新成功相反,基准和分析突出了构建稳健且可泛化的LMA的必要性。

🎯

关键要点

  • LMA在基本任务上表现优于人类和强化学习代理。

  • 在任务组合的实际应用中,LMA的性能尚未得到充分探索。

  • 引入新的基准CompWoB,显示LMA在组合任务上的表现下降。

  • 设计的新模型HTML-T5++在MiniWoB上超过人类水平,并在CompWoB上取得最佳零样本性能。

  • 在不同指令组合下,改变组合顺序导致性能进一步下降。

  • 基准和分析强调了构建稳健且可泛化的LMA的重要性,以适应真实世界的部署。

🏷️

标签

➡️

继续阅读