REKLAMA

AI nauczyła się blefować. Najlepsi ludzie nie dali jej rady

W tej grze nie wystarczy liczyć ruchów. Trzeba blefować i zgadywać zamiary rywala. Nowa AI robi to lepiej od najlepszych ludzi.

Ataraxos rozbił mistrza Stratego. AI opanowała blef

Komputer już od bardzo dawna potrafi ograć człowieka w szachy, ale tam wszystkie figury leżą na stole. W Stratego przeciwnik ukrywa tożsamość swoich pionów, więc dobra gra wymaga nie tylko planowania, lecz także wyciągania wniosków z niepełnych informacji, podejmowania ryzyka i blefowania. Ataraxos właśnie pokazał, że sztuczna inteligencja poradziła sobie również z tym problemem. W serii 20 partii pokonał Pima Niemeijera, czterokrotnego mistrza świata i jednego z najbardziej utytułowanych zawodników w historii Stratego, wynikiem 15 zwycięstw, jednej porażki i czterech remisów.

W szachach wszystko widać. Tutaj połowa gry jest ukryta

Stratego na pierwszy rzut oka może przypominać trochę szachy wojskowe. Dwóch graczy ustawia po 40 pionów reprezentujących żołnierzy różnej rangi, bomby oraz flagę, a później próbuje przedrzeć się przez planszę i zdobyć flagę przeciwnika. Tyle że na początku każdy widzi wyłącznie własne jednostki. Tożsamość pionu rywala poznaje dopiero wtedy, gdy dojdzie do starcia.

Dlatego samo liczenie kolejnych ruchów nie wystarcza. Gracz obserwuje, które piony przeciwnik przesuwa, których chroni, gdzie zachowuje się ostrożnie i gdzie nagle zaczyna ryzykować. Jednocześnie sam próbuje przekazać rywalowi jak najmniej prawdziwych informacji. Słabszy pion można prowadzić tak, jakby był znacznie cenniejszy, a bardzo ważną jednostkę zachowywać się w sposób, który nie zwraca uwagi.

Właśnie takie gry długo pozostawały znacznie trudniejsze dla systemów AI niż szachy czy Go. Naukowcy związani z MIT, Carnegie Mellon University, New York University i Stanford University opisali Ataraxosa w nowym badaniu. System osiągnął w Stratego poziom, którego wcześniejsze modele nie potrafiły uzyskać nawet przy znacznie większym budżecie obliczeniowym.

AI pokonywała ludzi w szachach już dekady temu, a AlphaZero potrzebowała zaledwie kilku godzin samodzielnej gry, żeby przebić najlepsze silniki szachowe. Stratego stawia jednak inny problem. Liczba możliwych początkowych ustawień przekracza 10 do potęgi 66, a do tego model nie wie, z którym z tych ustawień naprawdę ma do czynienia.

Ataraxos najpierw gra sam ze sobą

Podstawą treningu jest self-play, czyli mechanizm dobrze znany z wcześniejszych sukcesów AI w grach. Ataraxos rozgrywa ogromną liczbę partii sam ze sobą i na tej podstawie buduje podstawową strategię. Nie dostaje bazy ludzkich partii, z której próbuje kopiować zachowania mistrzów.

Nowością nie jest więc samo uczenie przez samodzielną grę, lecz to, co dzieje się później. System został rozdzielony na kilka elementów. Osobna sieć uczy się ustawiania pionów na początku partii, kolejna odpowiada za ich późniejsze prowadzenie, a jeszcze inny model próbuje na bieżąco oszacować, co może znajdować się po drugiej stronie planszy.

Przed wykonaniem ruchu Ataraxos nie przyjmuje jednego zgadywanego ustawienia przeciwnika. Generuje zestaw najbardziej prawdopodobnych wariantów rozmieszczenia ukrytych pionów, sprawdza swoje możliwe ruchy w tych scenariuszach i dopiero wtedy wybiera działanie.

To pozwala mu zmieniać ocenę sytuacji podczas samej partii. Jeżeli przeciwnik przez kilkanaście ruchów zachowuje się tak, jakby konkretny pion był bardzo cenny, model może zwiększyć prawdopodobieństwo, że rzeczywiście nim jest. Może też dojść do wniosku, że człowiek próbuje go w ten sposób oszukać.

Człowiek blefuje. AI też

Autorzy przeanalizowali później sposób gry systemu i porównali go z zachowaniem zawodników. Wyszło, że Ataraxos wcale nie kopiuje po prostu ludzkiego stylu. Niektórych popularnych blefów używa rzadziej od ludzi, ale w innych sytuacjach podejmuje ryzyko, którego doświadczeni gracze zwykle unikają. Potrafi prowadzić pion w sposób utrudniający rozpoznanie jego rangi i długo zachowywać jednostki, które ludzie często poświęcają wcześniej. Kiedy przegrywa, gra również bardziej agresywnie i utrudnia przeciwnikowi wykorzystanie przewagi.

Sam Niemeijer miał więc okazję zobaczyć to przez 20 kolejnych partii. Nie był przypadkowym graczem, bo czterokrotnie zdobywał mistrzostwo świata, 15 razy mistrzostwo Holandii, a na pierwszym miejscu światowego rankingu spędził łącznie ponad 600 tygodni. Ataraxos wygrał z nim 15 razy. Przegrał raz i cztery partie zremisował. To istotne także dlatego, że człowiek znał charakter eksperymentu i wiedział, że system nie będzie specjalnie dostosowywany do jego indywidualnego sposobu gry. Miał więc serię partii, żeby znaleźć powtarzalną słabość i próbować ją wykorzystać. Wynik pokazuje, że nie było to łatwe.

Jeszcze ciekawsze jest porównanie z DeepNash, systemem pokazanym przez DeepMind w 2022 r. Był to wtedy największy krok w stronę opanowania Stratego przez AI i model osiągał poziom bardzo dobrych ludzkich graczy. Ataraxos okazał się wyraźnie mocniejszy, a jednocześnie był znacznie tańszy w treningu.

Zespół podaje, że potrzebował mniej niż jednej setnej liczby przykładów treningowych wykorzystanych przy DeepNash i mniej niż jednej trzydziestej liczby partii self-play. Łączny koszt treningu autorzy określają na kilka tysięcy dolarów, podczas gdy wcześniejsze przemysłowe eksperymenty ze Stratego pochłaniały znacznie większe środki.

To bardzo ważna część wyniku, bo nie chodzi tylko o to, że wrzucono więcej procesorów i po raz kolejny przepchnięto problem większą skalą. Badacze opracowali sposób, dzięki któremu model efektywniej uczy się gry z ogromną ilością ukrytej informacji. Podobne mechanizmy sprawdzili też w innych grach.

Ataraxos osiągnął nadludzki poziom w szybszej odmianie Stratego, ustanowił nowe wyniki w kooperacyjnym Hanabi i poprawił wcześniejsze osiągnięcia AI w chińskiej grze karcianej Dou Dizhu. Każda z nich inaczej rozdziela informacje pomiędzy uczestników.

To nie jest pierwszy raz, gdy AI musi rozgryźć człowieka

Gry z ukrytą informacją już wcześniej były kolejnym etapem rywalizacji ludzi ze sztuczną inteligencją. Cicero od Mety potrafiło grać w Dyplomację, gdzie trzeba rozmawiać z innymi zawodnikami, zawierać sojusze i przewidywać ich zamiary. Stratego sprawdza trochę inną umiejętność. Nie ma rozmowy i negocjacji. Informacje trzeba wydobywać wyłącznie z ruchów przeciwnika, pamiętając przy tym, że każdy z nich może być próbą wprowadzenia nas w błąd.

Maszyna nie dostała więc tym razem pełnego obrazu sytuacji, który wystarczy coraz szybciej przeliczać. Musiała nauczyć się podejmować dobre decyzje również wtedy, gdy części odpowiedzi zwyczajnie nie zna.

Przeczytaj także:

Badacze wskazują na negocjacje, cyberbezpieczeństwo czy planowanie działań jako przykłady problemów, w których również trzeba podejmować decyzje na podstawie niepełnej wiedzy. Do takich zastosowań nadal daleko, bo planszowa gra ma jasno określone zasady, a rzeczywistość nie. Pokonanie mistrza Stratego pokazuje jednak, że ukrycie części informacji przed AI przestało być wystarczającym sposobem na odzyskanie przewagi człowieka.

*Grafika wprowadzająca wygenerowana przez AI

Marcin Kusz
Redaktor

Redaktor Spider's Web specjalizujący się w tematyce naukowej. O nowych technologiach zaczął pisać w 2012 r. na łamach portalu Telix. Później współtworzył treści dla Komputer Świata i PCLabu. Epizod dziennikarski zaliczył także w lokalnej gazecie i w dziale blogowym SpeedTest. Współzałożyciel agencji BlueCopy, zajmującej się copywritingiem i poligrafią. Przez pewien czas właściciel firmy transportowej. Prywatnie fan starych polskich oper mydlanych (oglądanych obowiązkowo z konkubiną), dumny opiekun kotki brytyjskiej i pasjonat-amator druku 3D.