AI ya Stratego ilishinda bora duniani 15-1 kwa GPU 16, si chipu 1,024
Ataraxos ilimshinda Pim Niemeijer michezo 15 kwa mmoja, na gharama ya mafunzo yake ndiyo habari kubwa zaidi. Matokeo haya yanathibitisha nini, na yasiyothibitisha nini.
Watafiti kutoka Carnegie Mellon, MIT, NYU na Stanford wanasema AI yao, Ataraxos, ilimshinda Pim Niemeijer, ambaye bila shaka ni mchezaji bora wa Stratego katika historia, michezo 15 kwa mmoja pamoja na sare nne. Kulingana na timu hiyo, ilifunzwa kwa GPU 16 kwa wiki moja, pamoja na GPU nne zaidi kwa siku nne. Jaribio la awali la DeepMind, DeepNash, lilitumia chipu maalum 1,024 kwa miezi miwili hadi mitatu, mradi ambao timu ya Ataraxos inakadiria kuwa na gharama ya dola milioni 3 hadi 4.5 kwa bei za mwaka 2025.
Kwa Nini Stratego Ilikuwa Ngumu
Stratego ni mchezo wenye taarifa pungufu (imperfect-information): unaweza kuona mahali vipande 40 vya mpinzani vilipo, lakini huwezi kujua ni vipande gani. Utambulisho hufichuliwa tu pale vipande vinapogongana. Poker pia ni mchezo wenye taarifa pungufu, lakini Texas Hold'em ina mikono 1,326 tu inayowezekana, idadi ndogo ya kutosha kupimwa yote. Stratego ina mipangilio ya awali inayozidi decillion moja, na mchezo unaweza kufikia hatua 2,000, ikilinganishwa na takriban 40 katika chess.
Udanganyifu (bluffing) unafanya mambo kuwa magumu zaidi. Ukisogeza kipande dhaifu kana kwamba ni marshal, unaweza kumtisha mpinzani, lakini ukidanganya mara nyingi mno vitisho vyako havina maana; usipodanganya kamwe, unatabirika. Watafiti wanasema usawa huo ndio uliozishinda mifumo ya awali.
Jinsi Ataraxos Inavyofanya Kazi
Kama DeepNash, Ataraxos ilijifunza kwa kucheza dhidi yake yenyewe (self-play), jumla ya michezo milioni 163: hatua zilizoleta ushindi zilichezwa mara nyingi zaidi, na zilizoleta kushindwa zilichezwa mara chache zaidi. Mabadiliko mawili yalikuwa muhimu. Kwanza, taarifa zilizofichwa huelekea kufanya mafunzo ya self-play yazunguke bila kufika popote, kwa hiyo timu ilifanya marekebisho makubwa ya mkakati mapema katika mafunzo na madogo baadaye.
Pili, inaweza kufikiria mbele kabla ya kila hatua, jambo ambalo DeepNash haikuwahi kufanya. Utafutaji wa aina hii (search), uliotumiwa na AlphaGo, ulionekana kuwa wa gharama kubwa mno katika Stratego kwa sababu kulikuwa na mpangilio mwingi mno wa bodi wa kuchunguza. Suluhisho lilikuwa mtandao wa pili wa neva (neural network), mfano wa imani (belief model), unaokisia vipande vilivyofichwa vya mpinzani kutokana na jinsi vilivyosogea. Badala ya kuorodhesha kila mpangilio, Ataraxos huchagua sampuli za mipangilio inayokubalika, hucheza hatua zinazowezekana katika kila mmoja, na huchagua kulingana na matokeo.
Kilichothibitishwa, na Kisichothibitishwa
Kilichothibitishwa: matokeo yaliyopitiwa na wataalamu wenzao (Nature, 2026) dhidi ya bingwa wa dunia mara nne, pamoja na ushindi 38 katika michezo 40 dhidi ya washiriki wa Mashindano ya Dunia ya 2025. Mbinu hiyo hiyo pia ilishinda mabingwa watatu wa dunia katika Barrage Stratego, ilimudu mchezo wa kadi wa ushirikiano Hanabi, na ilishinda bots bora katika dou dizhu.
Tahadhari zinazotolewa na chanzo chenyewe: mechi ya Niemeijer ilikuwa michezo 20 mtandaoni kwa wiki tatu, sampuli ndogo katika mchezo ambao bahati imejengewa ndani yake. Watafiti wanasema hata mkakati kamili wakati mwingine hushindwa. Niemeijer pia alijua kwamba AI haitajirekebisha kulingana naye, jambo lenye pande mbili: lilimpa muda wa kutafuta udhaifu, lakini pia linamaanisha jaribio halikuwahi kuhusisha mpinzani ambaye AI ilihitaji kujirekebisha kulingana naye.
Visivyothibitishwa: chochote nje ya michezo. Timu inapendekeza michezo ya vita (war gaming), mazungumzo ya makubaliano (negotiation) na masoko ya fedha kama malengo ya baadaye, na inahoji kwamba pengo ni dogo kuliko linavyoonekana kwa sababu tatizo lolote halisi huanza na mfano uliorahisishwa. Hiyo ni hoja, si matokeo. Matatizo halisi hayana sheria zisizobadilika wala washindi walio wazi, na hakuna aliyeonyesha Ataraxos ikifanya kazi kwenye tatizo kama hilo. Mfumo pia hauwezi kueleza hatua zake; Farina alisema timu bado haijafikia mikakati madhubuti inayoweza kueleweka.
Maswali Unayopaswa Kujiuliza
- Kama ongezeko la ufanisi lilitokana kwa kiasi kikubwa na simulator maalum inayoendesha mamilioni ya hatua kwa sekunde kwenye GPU, ni kiasi gani kinaweza kuhamishiwa kwenye eneo ambalo hakuna simulator kama hiyo?
- Belief model inakisia taarifa zilizofichwa kutokana na tabia iliyoonekana. Itakuwaje pale tabia ya mpinzani isipofanana kabisa na wapinzani wa self-play ambao ilifunzwa dhidi yao?
- Michezo ishirini ni sampuli ndogo. Ingehitajika michezo mingapi kutofautisha ubora halisi na bahati, na je, tofauti ya 15-1 ingedumu dhidi ya mpinzani anayeweza kujirekebisha?
- Kwa matumizi halisi kama mazungumzo ya makubaliano au uigaji wa migogoro, nani anajenga mfano uliorahisishwa, na nani anahakikisha unaakisi uhalisia badala ya dhana za mjenzi wake?
- Kama mfumo hauwezi kueleza hatua zake, ungekaguaje pendekezo kabla ya kulitekeleza?
Cha Kufuatilia Baadaye
Ishara ni kama mbinu hii itatoka kwenye michezo. Fuatilia matumizi yaliyochapishwa ambapo sheria hazijawekwa na hakuna simulator ya bei nafuu, na maendeleo katika pengo la kueleza (explainability) ambalo Farina alikiri. Hadi hapo, matokeo thabiti ni uchezaji wa bei nafuu na wenye nguvu zaidi katika michezo yenye taarifa zilizofichwa, si zana ya jumla ya mazungumzo ya makubaliano au masoko.
- 1Boresha ufanisi wa mafunzo ya AI kwa kutumia algorithms maalum badala ya nguvu ghafi ya kompyuta ili kupunguza gharama kwa zaidi ya 99%.
- 2Tumia mikakati ya michezo yenye taarifa pungufu kuboresha mifumo ya kufanya maamuzi pale data inapokuwa pungufu au imefichwa.
- 3Linganisha utendaji wa AI na wataalamu wa kibinadamu katika maeneo magumu ili kuthibitisha matumizi halisi zaidi ya majaribio ya kubuni.
Ready to implement AI in your business?
Our team builds the AI systems you just read about. Start with a free 30-minute discovery meeting.
