AI が史上最強 Stratego 選手を撃破
原題: With most information hidden, the game Stratego had stumped AI until now
なぜ重要か
隠蔽情報×超長期の意思決定という従来 AI の弱点を低コストで突破したことは、サプライチェーンや交渉など実世界の不完全情報問題への応用可能性を示す。
Carnegie Mellon・MIT・NYU・Stanford の共同研究チームが開発した AI「Ataraxos」が、史上最強とされる Stratego プレイヤー Pim Niemeijer に20ゲームで15勝1敗4引き分けという圧倒的スコアで勝利した。学習に使ったのはわずか16基の GPU と数千ドル。DeepMind でさえ達成できなかった隠蔽情報ゲームの最難関を、低コストで突破した成果として注目される。
チェスでは Deep Blue が1997年に Kasparov を下し、囲碁では AlphaGo が2016年に Lee Sedol を破った。ポーカーも数年前にコンピュータが人間プロを超えた。だが Stratego は違った。DeepMind でさえ、人間トップ選手に安定して勝てる AI を作れなかった。
Stratego は各プレイヤーが40枚の駒を持つボードゲームで、駒の種類は相手には見えない。Texas Hold'em ポーカーの隠し情報が最大1,326通りであるのに対し、Stratego の初期配置は「10の33乗」を超える「デシリオン」超の組み合わせがある。さらに一局が2,000手に及ぶことも珍しくない。チェスの平均40手と比べて、情報の不確実性が時間軸上に長大に展開する点が独特だ、と共著者の NYU 研究者 Eugene Vinitsky は述べている。
Ataraxos の技術的な肝は二点ある。一つ目は学習スケジュールの工夫で、自己対戦1億6,300万ゲームを通じて、序盤は大胆に戦略を変更し、後半は小幅な調整に切り替えた。隠蔽情報ゲームの自己対戦学習が循環しやすい問題を、この段階的な変化量制御で緩和した。
二つ目が最大の革新で、DeepMind の DeepNash にはなかった「行動前の先読み(サーチ)」機能だ。従来は隠れた情報のせいで Stratego にサーチを適用できなかった。Ataraxos はここで、相手の隠し駒の正体を推定する第二のニューラルネットワークを導入。このネットワークが盤面から敵駒の種類を確率的に予測し、その推定をサーチに組み込んで最善手を計算する仕組みを実現した、と MIT の Gabriele Farina は説明している。
ブラフの均衡問題も克服した。弱い駒を強い駒のように動かすブラフが多すぎると脅威が薄れ、少なすぎると行動が読まれる。この均衡点を自己対戦を通じて体得させたことが、Niemeijer 戦での圧勝につながった。