LMA在基本任务上表现优于人类和强化学习代理,但在涉及任务组合的实际应用中,性能仍未得到充分探索。通过引入新的基准CompWoB,展示了LMA在组合任务上的表现下降。设计了新模型HTML-T5++,在MiniWoB上超过人类水平并在CompWoB上取得最佳零样本性能。然而,在改变组合顺序的不同指令组合下,性能进一步下降。与LMA的最新成功相反,基准和分析突出了构建稳健且可泛化的LMA的必要性。
完成下面两步后,将自动完成登录并继续当前操作。