Ataraxos postavio novi standard za AI u igri Stratego

Istraživači sa MIT-a, Carnegie Mellon University, New York University i Stanford University razvili su sistem Ataraxos, koji je u igri Stratego ostvario skor 39-2 protiv vrhunskih ljudskih igrača i savladao najjačeg svetskog igrača rezultatom 15-1-4. Rad o sistemu objavljen je u časopisu Nature, a tim navodi da Ataraxos nadmašuje ranije modele uz znatno manji obim obuke.
Zašto je Stratego težak test za veštačku inteligenciju
Stratego je igra za dva igrača sa nepotpunim informacijama. Svaki igrač raspoređuje 40 figura, ali identitet protivničkih figura ostaje skriven dok se ne sretnu na tabli. Cilj je zauzimanje protivničke zastave, dok sukob figura otkriva njihov rang i uklanja slabiju figuru.
Broj mogućih konfiguracija figura premašuje 10 na 66. stepen, što je eksponencijalno više nego u šahu. Zbog toga sistem ne može praktično da razmotri svaku moguću situaciju na tabli, niti se može osloniti na pristupe razvijene za igre poput pokera.
U okruženju sa skrivenim informacijama vrednost poteza zavisi i od toga kako protivnik tumači prethodne odluke. Blefiranje, prikrivanje namere i izostanak akcije mogu menjati ponašanje druge strane, pa najbolji potez nije nužno isti u svakom ponavljanju slične situacije.
Kombinacija samostalne igre i planiranja tokom partije
Ataraxos je treniran metodom učenja potkrepljivanjem kroz samostalnu igru. Sistem odigrava veliki broj partija protiv sebe kako bi izgradio početnu, odnosno „blueprint” strategiju za raspored figura i vođenje igre. Istraživači su pritom koristili efikasnije algoritme kako model ne bi pokušavao da predvidi svaki mogući naredni potez.
Tokom konkretne partije početna strategija nije jedini oslonac. Ataraxos koristi planiranje u trenutku odlučivanja: generativni model verovatnosno procenjuje identitete skrivenih protivničkih figura, a sistem potom vrednuje buduće izbore pre nego što odigra potez. Takav postupak omogućava da procena bude vezana za konkretnu tablu i konkretnog protivnika.
Gabriele Farina navodi da Ataraxos postiže veću igračku snagu od DeepNasha, DeepMindovog sistema, uz manje od stotog dela primera za obuku i manje od tridesetog dela partija samostalne igre. Raniji pokušaji bili su računski zahtevni i skupi, ali nisu dostigli nivo potreban za pobedu nad najboljim ljudskim igračima Stratega.
Šta rezultat govori o primeni izvan igara
Isti pristup prilagođen je igrama Barrage Stratego, Hanabi i Dou dizhu, pri čemu je sistem u svakoj ostvario nadljudske rezultate. To pokazuje da metoda nije ograničena na jedno pravilo igre ili jedan raspored učesnika.
Istraživači kao moguće oblasti primene navode poslovne pregovore, sajberbezbednost i situacije slične vojnim manevrima, gde učesnici nemaju potpun uvid u namere i pozicije drugih strana. Ipak, pre stvarne primene žele da uvedu mere interpretabilnosti kako bi ljudi mogli da razumeju i revidiraju preporuke sistema.
Za poslovanje je ključna poruka da napredni modeli za neizvesne situacije ne bi trebalo da budu prihvaćeni samo zbog kvaliteta rezultata. Njihova preporuka može imati vrednost tek kada odgovorna osoba može da proveri odluku i zadrži poslednju reč.

