AI, 역사상 최강 Stratego 선수 꺾다

원제: With most information hidden, the game Stratego had stumped AI until now

왜 중요한가

불완전 정보와 초장기 게임이라는 이중 난제를 저비용으로 해결한 접근법은 실세계 의사결정 AI에 직접 응용 가능성이 있다.

카네기멜론·MIT·NYU·스탠퍼드 공동 연구팀이 개발한 AI 'Ataraxos'가 2026년 10월, 역대 최강 Stratego 선수로 꼽히는 Pim Niemeijer를 15승 1패 4무로 격파했다. 학습에 GPU 16개와 수천 달러만 투입한 저비용 모델로, DeepMind도 풀지 못한 난제를 해결했다.

체스는 1997년 Deep Blue, 바둑은 2016년 AlphaGo가 정복했다. 포커도 수년 전 봇이 프로를 넘어섰다. 하지만 보드게임 Stratego는 달랐다. DeepMind조차 최고 인간 선수를 안정적으로 이기는 AI를 만들지 못했다.

Stratego는 군사 계급을 상징하는 40개 말을 이용해 상대 깃발을 빼앗는 게임이다. 말의 위치는 보이지만 정체는 전투 전까지 알 수 없다. 이 '불완전 정보' 특성 자체는 포커와 유사하지만, 규모가 다르다. 텍사스 홀덤에서 숨겨진 패는 고작 2장(1,326가지 조합)인 반면, Stratego에서는 40개 말의 배치 경우의 수가 10의 32제곱을 넘는다. 게임 길이도 체스의 평균 40수와 달리 최대 2,000수에 달한다.

Ataraxos는 자가 대전(self-play) 방식으로 1억 6,300만 게임을 학습했다. 핵심 혁신은 두 가지다. 첫째, 학습 초기에는 전략을 대폭 바꾸고 후기에는 소폭 조정하는 방식으로 불완전 정보가 유발하는 '학습 루프' 문제를 해결했다. 둘째, 상대 말의 정체를 추론하는 별도 신경망을 추가해 수를 두기 전에 '생각'하는 탐색(search) 기능을 구현했다. DeepMind의 DeepNash(2022년)가 끝내 탑재하지 못했던 기능이다.

연구팀은 GPU 16개와 수천 달러 수준의 훈련 비용으로 이 성과를 냈다. 블러핑의 균형—너무 자주 하면 위협이 무의미해지고 안 하면 예측 가능해지는—을 AI가 스스로 터득한 점도 주목할 만하다.

출처

arstechnica.com — 원문 읽기 →