AI ने Stratego में विश्व चैंपियन को हराया
मूल शीर्षक: With most information hidden, the game Stratego had stumped AI until now
यह क्यों महत्वपूर्ण है
छुपी जानकारी वाले जटिल खेलों में AI की सफलता, वास्तविक दुनिया की अधूरी-जानकारी वाली समस्याओं के लिए नई संभावनाएँ खोलती है।
Carnegie Mellon, MIT, NYU और Stanford के शोधकर्ताओं के AI 'Ataraxos' ने Stratego के सर्वश्रेष्ठ खिलाड़ी Pim Niemeijer को 15-1 से हराया। प्रशिक्षण में केवल 16 GPU और कुछ हज़ार डॉलर खर्च हुए।
1997 में Deep Blue ने chess में Kasparov को हराया, 2016 में AlphaGo ने Go में Lee Sedol को। लेकिन Stratego बोर्ड गेम दशकों तक AI के लिए अजेय रहा — यहाँ तक कि DeepMind भी इसमें विफल रही। अब चार अमेरिकी विश्वविद्यालयों के शोधकर्ताओं ने 'Ataraxos' नामक AI बनाया जिसने Stratego के सर्वकालिक सर्वश्रेष्ठ खिलाड़ी Pim Niemeijer को 20 में से 15 बाज़ियाँ जीतकर, 4 ड्रॉ और केवल 1 हार के साथ पराजित किया।
Stratego की कठिनाई इसकी छुपी जानकारी में है। प्रत्येक खिलाड़ी के पास 40 मोहरे होते हैं — Marshal से Spy तक — जिनकी पहचान प्रतिद्वंद्वी को तब तक नहीं पता जब तक दो मोहरे आमने-सामने न हों। NYU के शोधकर्ता Eugene Vinitsky के अनुसार, "Stratego में छुपी जानकारी बहुत विशाल है और बहुत लंबे समय तक बनी रहती है।" MIT के Gabriele Farina ने बताया कि Texas Hold'em Poker में केवल 1,326 संभावित हाथ होते हैं, जबकि Stratego में 40 मोहरों की संभावित व्यवस्थाएँ एक decillion से भी अधिक हैं। इसके अलावा, एक बाज़ी 2,000 चालों तक चल सकती है।
Ataraxos ने 16.3 करोड़ self-play बाज़ियाँ खेलकर सीखा। इसकी सबसे बड़ी तकनीकी नवीनता थी एक दूसरा neural network जो छुपे मोहरों की पहचान का अनुमान लगाता है। DeepMind के 2022 के DeepNash में यह क्षमता नहीं थी। इसके साथ ही, प्रशिक्षण की शुरुआत में बड़े बदलाव और बाद में सूक्ष्म समायोजन की रणनीति ने self-play के circular learning जाल से बचाया।