MIT、卡内基梅隆大学、纽约大学和斯坦福大学研发的 Ataraxos 在 Stratego 中击败顶尖人类玩家,研究发表于 Nature。系统结合自我博弈强化学习与生成模型辅助的决策时规划,训练样本量不到 DeepNash 的 1/100、自我博弈局数不到其 1/30,棋力却更高,并在 Stratego 世界锦标赛对阵顶尖人类玩家时取得 39-2 的战绩。
阅读原文