发生了什么
麻省理工学院、卡内基梅隆大学、纽约大学与斯坦福大学的研究团队在《自然》发表论文《Scalable decision-making for games of imperfect information》,提出 AI 系统 Ataraxos。《西洋陆军棋》(Stratego)双方的 40 枚棋子身份在发生碰撞前互相保密,可能的初始布阵超过 10 的 66 次方,长期被视为不完全信息决策的严苛基准。
- 该项目历史最强者、荷兰选手 Pim Niemeijer 的 20 局系列赛:Ataraxos 15 胜 1 负 4 和,有效胜率约 85%
- 2025 年世锦赛期间向参赛者开放的 40 局:38 胜 2 负(MIT 新闻稿口径为 39 胜 2 负)
- 同一套方法在 Barrage Stratego、花火(Hanabi)与斗地主上同样达到超人类水平
- 代码以 MIT 许可公开
成本对比是本轮真正的看点
论文给出的成本口径显示,此前的 DeepNash 在 1024 个 TPU v3 节点上训练两到三个月,按 2025 年价格估算约需 300 万至 450 万美元。Ataraxos 的策略网络用 16 张 H100 训练一周,信念网络用 4 张 H100 训练四天,作者估算合计不到 8000 美元。团队称其训练样本量不到对手的百分之一,自我对弈局数不到三十分之一,计算开销约为五百分之一,并把这归因于自研的 GPU 模拟器与更高的样本效率。
方法:自博弈加决策时规划
Ataraxos 不依赖任何人类棋谱,纯靠自我对弈学习基础策略。训练中额外加入正则化条件,迫使系统分散开局与走法,避免过早锁定固定套路;随后随训练推进逐步放松该约束并调整学习步长,以防在不完全信息博弈中陷入循环或震荡。实战阶段它再用一个生成式信念网络推断对手暗子的可能身份,结合当前盘面评估候选着法,这一步被称为决策时规划,作者认为这是超越人类的关键。
对企业的现实意义与边界
团队把商业谈判、网络安全与金融交易列为潜在应用场景,这些场景的共同点恰恰是看不到对手的全部底牌。但边界需要说清:目前所有已展示的胜利都发生在双方事先知晓规则、且可通过大量自我对弈反复试错的博弈中。高级作者 Gabriele Farina 表示,人类必须对是否采纳建议拥有最终决定权,因此在落地前需要能够审计模型决策的手段,这方面还有很长的路要走。
不确定之处
论文未披露与 DeepNash 的正面对局数据:研究团队曾提出安排对抗赛,DeepMind 回复称 DeepNash 代码已无法运行,因此比较只能建立在资源消耗口径上。此外,比赛时间控制、交互界面与人类选手是否可查阅资料等条件未在公开材料中完整说明,独立复现也尚未出现;MIT 新闻稿与《自然》论文在世锦赛战绩上还存在 39 胜与 38 胜的口径差异。

