AI pokonuje mistrza Stratego. Koniec ludzkiej dominacji?

Stratego przez dekady pozostawało jedną z niewielu gier planszowych, w których ludzie regularnie wygrywali z maszynami. Sytuacja właśnie się zmieniła. Zespół badawczy opracował system Ataraxos, który nie tylko pokonał najbardziej utytułowanego zawodnika w historii tej gry, ale zrobił to przy minimalnym budżecie obliczeniowym. To osiągnięcie podważa dotychczasowe przekonanie, że duża ilość ukrytych informacji stanowi nieprzekraczalną barierę dla sztucznej inteligencji.

Dlaczego Stratego było tak trudne dla AI

Stratego różni się zasadniczo od szachów czy Go. Obie strony rozstawiają swoje czterdzieści pionków w tajemnicy, a ich wartość bojowa ujawnia się dopiero w momencie starcia. Jak podkreślają autorzy publikacji, liczba możliwych konfiguracji początkowych przekracza 1033. Ta cecha sprawia, że gra należy do kategorii problemów z niepełną informacją.

Samuel Sokota, pierwszy autor pracy, wyjaśniał w mediach społecznościowych, że w takich warunkach wartość danego ruchu zależy nie tylko od przyszłego przebiegu partii, ale również od tego, co wydarzyło się wcześniej. To fundamentalna różnica względem gier o pełnej informacji, gdzie algorytmy osiągnęły już dawno nadludzkie wyniki.

Wcześniejsze metody wywodzące się z pokerowej AI radziły sobie z ukrytymi informacjami tylko w ograniczonym zakresie. W Texas Hold’em istnieje zaledwie 1326 możliwych układów startowych, a wysiłek obliczeniowy potrzebny do analizy rośnie wraz z liczbą niewiadomych. Stratego pozostawało więc jednym z ostatnich bastionów ludzkiej przewagi w grach planszowych.

Ataraxos kontra DeepNash: skromny budżet, wielki wynik

Historia tego sukcesu nabiera szczególnego wymiaru, gdy porównamy go z wcześniejszymi próbami. DeepMind, dysponujący ogromnymi zasobami, opracował system DeepNash, który trenował przez dwa do trzech miesięcy na 1024 węzłach TPU. Według szacunków autorów Ataraxos, koszt takiego przedsięwzięcia w cenach z 2025 roku wyniósłby od 3 do 4,5 miliona dolarów.

Zespół Ataraxos potrzebował zaledwie tygodnia na szesnastu kartach Nvidia H100, a następnie czterech dodatkowych dni na czterech GPU do wytrenowania sieci przekonań. Łączny koszt nie przekroczył ośmiu tysięcy dolarów. To około 1/500 nakładów obliczeniowych DeepMind, przy wykorzystaniu 1/30 liczby gier samodzielnych i 1/100 przykładów treningowych.

Badacze przypisują ten wynik napisanemu przez siebie symulatorowi GPU oraz znacznie wyższej efektywności próbkowania. Jak zauważa Sokota, zespół był ograniczony do akademickich zasobów obliczeniowych, co zmusiło go do wypracowania sprytniejszych rozwiązań.

Bezpośrednie porównanie obu systemów nie było możliwe. DeepMind poinformował, że kod DeepNash nie działa już poprawnie, więc nie można było przeprowadzić wspólnych testów. Warto jednak przypomnieć, że podczas mistrzostw świata w 2023 roku DeepNash wygrał 19 z 28 partii, ale przegrał z większością czołowych zawodników, w tym z Niemeijerem.

Klucz do sukcesu: różnorodność i sieć przekonań

Regularyzacja jako rezerwa energetyczna

Ataraxos uczy się wyłącznie poprzez rozgrywanie partii przeciwko sobie, bez wykorzystywania danych od ludzkich ekspertów. Autorzy podkreślają, że kluczowe znaczenie ma sposób, w jaki system jest zmuszany do urozmaicania swojej gry. Dodatkowy warunek podczas treningu sprawia, że AI rozprasza swoje ustawienia i ruchy, zamiast wcześnie blokować się w jednej strategii.

Ten mechanizm, nazywany regularyzacją, ma szczególne znaczenie w Stratego, gdzie silna gra wymaga dużej dozy losowości. Przewidywalni zawodnicy są bowiem łatwo wykorzystywani przez przeciwników. Badacze porównują regularyzację do rezerwy energetycznej: jeśli AI zużyje ją zbyt szybko, osiąga wprawdzie szybkie postępy, ale traci zdolność dalszego uczenia się i staje się podatna na eksploatację.

W miarę postępów treningu nacisk na różnorodność jest zmniejszany, a rozmiar kroków uczących dostosowywany. Wczesne fazy charakteryzują się dużymi skokami i intensywnym eksplorowaniem, późniejsze – bardziej przemyślanymi ruchami i drobnymi korektami. Zapobiega to zapętlaniu się procesu uczenia, typowemu dla gier z niepełną informacją.

Przewidywanie ukrytych pionków przeciwnika

System wykorzystuje również sieć przekonań, która przewiduje, jakie figury skrywa przeciwnik. Przed każdym ruchem AI generuje możliwe stany gry, analizuje kandydackie posunięcia i wykonuje dodatkowy krok uczący specjalnie dla tej decyzji. Autorzy zaznaczają, że wcześniejsze prace pomijały tego typu przeszukiwanie, uznając je za zbyt trudne przy tak dużej liczbie ukrytych informacji.

Pojedynek z mistrzem i jego kulisy

Seria przeciwko Niemeijerowi została rozłożona na trzy tygodnie, aby uniknąć zmęczenia i dać zawodnikowi czas na przygotowanie. Niemeijer zdawał sobie sprawę, że Ataraxos nie będzie dostosowywać się do jego stylu gry. Otrzymał tysiąc dolarów za udział oraz dodatkowe sto dolarów za każde zwycięstwo i pięćdziesiąt za remis, co dawało mu finansową motywację do najlepszej możliwej gry.

Skuteczność na poziomie 85 procent, licząc remisy jako połowę wygranej, jest bezprecedensowa na najwyższym poziomie rozgrywek. Max Roelofs, dwukrotny wicemistrz świata, zwraca uwagę, że marginesy na szczycie są niezwykle wąskie, ponieważ gra wymusza na zawodnikach podejmowanie ryzyka.

AI grała jednak ze strukturalnym utrudnieniem. Niemeijer mógł dostosowywać się do niej przez wiele partii, podczas gdy system nie miał takiej możliwości. Vincent de Boer, trzykrotny mistrz świata, uważa to za poważny handicap. Podczas pokazu towarzyszącego mistrzostwom świata w 2025 roku Ataraxos wygrał 38 z 40 partii przeciwko turniejowym zawodnikom.

Gracze opisują styl systemu jako trudny do odczytania. AI stosuje blefy, które ludzie uznają za zbyt ryzykowne, a gdy przegrywa, zwleka tak uporczywie, że niektórzy odbierają to jako nieuprzejmość. Sprawia też wrażenie niemal niesamowicie szczęśliwej, ponieważ jej pionki zdają się zawsze znajdować w idealnym miejscu.

Metoda działa znacznie szerzej niż Stratego

Badacze zastosowali tę samą metodę do budowy innych systemów. W wariancie Barrage Stratego ich AI wygrała cztery serie po pięćdziesiąt partii przeciwko trzem z czterech najwyżej sklasyfikowanych zawodników, z których każdy był dwukrotnym mistrzem świata w tej odmianie. W kooperacyjnej grze karcianej Hanabi system ustanowił nowe rekordy w każdym wariancie, a w wersji dwuosobowej potrzebował o dwa rzędy wielkości mniej mocy obliczeniowej niż poprzedni lider.

W chińskiej grze karcianej Dou dizhu Ataraxos pokonał PerfectDou i DouZero, wcześniejsze systemy referencyjne. Autorzy wyciągają z tych wyników daleko idący wniosek: duże ilości ukrytych informacji przestały być przeszkodą dla uczenia ze wzmocnieniem i przeszukiwania. Oznaczałoby to, że praktyczne zastosowania AI stają się osiągalne dla wielu problemów decyzyjnych, o ile można zbudować szybkie i dokładne symulatory.

Publikacja wskazuje rynki finansowe, konflikty zbrojne i negocjacje jako przykłady sytuacji charakteryzujących się niepełną informacją. Badacze przyznają jednak pewne ograniczenie: ponieważ przeszukiwanie naśladuje tylko pojedynczy krok uczenia, jego wydajność nie poprawia się wraz z dodawaniem czasu obliczeniowego. Bardziej wyrafinowana metoda przeszukiwania mogłaby to zmienić.

Kod Ataraxos został udostępniony publicznie, co otwiera drogę do dalszych badań i zastosowań w innych dziedzinach wymagających podejmowania decyzji przy niepełnej wiedzy o stanie otoczenia.

Źródło