语言模型代理在 Web 自动化中受到构成性泛化的影响
原文中文,约400字,阅读约需1分钟。
📝
内容提要
LMA在基本任务上表现优于人类和强化学习代理,但在涉及任务组合的实际应用中,性能仍未得到充分探索。通过引入新的基准CompWoB,展示了LMA在组合任务上的表现下降。设计了新模型HTML-T5++,在MiniWoB上超过人类水平并在CompWoB上取得最佳零样本性能。然而,在改变组合顺序的不同指令组合下,性能进一步下降。与LMA的最新成功相反,基准和分析突出了构建稳健且可泛化的LMA的必要性。
🎯
关键要点
-
LMA在基本任务上表现优于人类和强化学习代理。
-
在任务组合的实际应用中,LMA的性能尚未得到充分探索。
-
引入新的基准CompWoB,显示LMA在组合任务上的表现下降。
-
设计的新模型HTML-T5++在MiniWoB上超过人类水平,并在CompWoB上取得最佳零样本性能。
-
在不同指令组合下,改变组合顺序导致性能进一步下降。
-
基准和分析强调了构建稳健且可泛化的LMA的重要性,以适应真实世界的部署。
🏷️