带有延迟反馈的强化学习优化中的改进后悔度
原文中文,约400字,阅读约需1分钟。
📝
内容提要
本文介绍了一种在线牛顿步骤算法,适用于广泛实际损失函数。研究了二阶赌博算法在具有仿射结构的损失函数中的应用。解决了赌博LQR/LQG问题。证明了BCO与内存问题更难,给出了遗憾界的下界。
🏷️