本研究探讨了逆约束学习(ICL)中推断约束的问题,发现ICL恢复的是不可避免失败的状态集合,而非已发生失败的状态。这一发现可能影响策略搜索的样本效率和学习约束的可转移性。
完成下面两步后,将自动完成登录并继续当前操作。