有界契约是否可学习和近似最优?
原文中文,约400字,阅读约需1分钟。
📝
内容提要
本研究通过优化问题将上下文马尔可夫决策过程中的迁移学习问题转化为因果效应识别问题,并通过线性规划获得因果模型和因果边界。实验证明因果增强算法优于传统方法,收敛速度更快。
🏷️