内容提要
麻省理工等团队开发AI系统Ataraxos,在隐藏信息的棋盘游戏Stratego中大幅击败顶尖人类玩家。它结合自对弈强化学习与决策时规划,训练成本远低于DeepMind的DeepNash,并能推广至多款游戏,未来或助军事、商业谈判等现实决策。
延伸解读
隐藏信息博弈的突破
Stratego的难点在于对手棋子身份未知,可能配置超过10的66次方种,远超象棋。传统针对扑克等隐藏信息游戏的技术无法扩展。Ataraxos通过自对弈强化学习与决策时规划,结合生成模型估计对手棋子身份,从而在巨大不确定性中做出合理决策。这标志着AI在隐藏信息博弈领域迈出重要一步。
效率与性能的双重优势
相比DeepMind的DeepNash,Ataraxos训练成本大幅降低:仅用不到百分之一的训练样本和不到三十分之一的自对弈局数,就达到更高棋力。这得益于高效训练算法和决策时规划,避免枚举所有可能。这种效率提升使AI系统更易推广到其他领域,降低应用门槛。
从游戏到现实决策的潜力
Ataraxos在Barrage Stratego、Hanabi、斗地主等不同规则游戏中均达到超人水平,展示出通用性。研究人员希望将其用于军事推演、商业谈判、网络安全等现实隐藏信息场景。但现实问题更复杂,且需人类最终决策,因此未来需增强模型可解释性,以便审计和信任。
Q&A
Ataraxos是什么?它有什么主要成就?
Ataraxos是由MIT、卡内基梅隆大学、纽约大学和斯坦福大学的研究人员开发的一款AI系统,专门用于处理隐藏信息的棋盘游戏。它在Stratego游戏中以15-1-4的比分击败了世界最强人类玩家,并在世界锦标赛中对顶尖人类选手取得了39-2的战绩,性能远超之前的模型。
Ataraxos与DeepMind的DeepNash相比,在训练效率和性能上有何优势?
Ataraxos在训练效率上远优于DeepNash:它使用的训练样本不到DeepNash的百分之一,自对弈局数不到三十分之一,但达到了更高的游戏强度。DeepNash虽然训练成本高昂,但仍无法击败顶尖人类Stratego玩家,而Ataraxos做到了。
Ataraxos采用了哪些关键技术来实现超人类表现?
Ataraxos结合了自对弈强化学习和决策时规划。它通过自对弈学习一个强大的“蓝图策略”,并设计了高效算法避免陷入预测所有可能走法的困境。在游戏过程中,它使用生成模型估计对手隐藏棋子的可能身份,并在决策时规划中评估未来选择,从而实时优化决策。
为什么Stratego对AI来说特别具有挑战性?
Stratego是一种不完全信息游戏,对手棋子的身份在碰撞前是隐藏的,可能的棋子配置超过10的66次方,远多于国际象棋。这种隐藏信息导致决策相互交织,难以推理最佳策略,例如虚张声势的效果会随使用频率变化,不像国际象棋有固定的最佳走法。
Ataraxos能否应用于其他游戏或现实场景?
是的,Ataraxos已被成功适配到其他不完全信息游戏,如Barrage Stratego、Hanabi和斗地主,并在这些游戏中均达到超人类水平。研究人员认为,该系统未来可帮助人类解决现实中的隐藏信息问题,如军事演习、商业谈判或网络安全。
Ataraxos的未来发展方向是什么?
研究人员计划为Ataraxos增加可解释性措施,使系统能够以人类可理解的方式解释其决策过程。Farina表示,在采用之前需要一种审计模型决策的方法,人类必须对是否遵循建议有最终决定权,这些算法有望成为未来更多工作的基础。