Skvelá správa: Vedci učia techniky AI vyhýbať sa prenasledovaniu

Vedec z Pekingskej univerzity nedávno publikoval predtlač podrobného vedeckého článku

systém založený na videohrách navrhnutý na výcvik hostiteľov AI, aby sa vyhli prenasledovaniu.

Aká je podstata

Najviac výskumov v žánri“vyhýbanie sa prenasledovaniu” v AI a teórii hier sa zaoberajú výučbou strojov na skúmanie vesmíru. Keďže väčšina školení AI zahŕňa systém, ktorý odmeňuje stroj za dosiahnutie cieľa, vývojári často používajú gamifikáciu ako stimul na učenie.

Inými slovami, nemôžete len tak strčiť robota do miestnosti a povedať “urob toto”. Musíte mu dať ciele a dôvod na ich dosiahnutie. Pretovedci vyvíjajú AI, ktorá sa svojou povahou snaží odmeňovať,

Prostredie tradičného výcviku spravodajstva je výzvouAgent AI má za úlohu manipulovať s digitálnymi modelmi, aby preskúmal vesmír, kým nesplní svoje ciele alebo nenájde odmenu. Pripomína to Pac Mana: AI sa musí pohybovať po prostredí, kým nezje všetky pelety odmeny.

História problému

Už od AI systémov DeepMindzvládol šach a choď, SCII sa stalo primárnym tréningovým prostredím pre konkurenčnú AI. Je to hra, v ktorej proti sebe prirodzene stoja hráči, AI alebo kombinácie hráčov a AI.

Ale čo je dôležitejšie, DeepMind a ďalšívýskumné organizácie už urobili kus práce, aby zo zdrojového kódu hry urobili ihrisko AI s niekoľkými minihrami, ktoré vývojárom umožňujú sústrediť sa na svoju prácu.

Výskumník Xun Huang, spomínaný vedecz Pekingskej univerzity sa rozhodli študovať “paradigmu prenasledovania a vyhýbania sa” na trénovanie modelov AI. Zistil som však, že model SCII má určité obmedzujúce obmedzenia: v vstavanej verzii hry “pursuit-evasion” Ovládanie prenasledovateľov môže byť zverené iba AI.

Základná schéma obsahuje tri prenasledovaniepostava (reprezentovaná vojakmi z hry) a 25 evader postáv (reprezentovaná mimozemšťanmi z hry). K dispozícii je aj režim, ktorý využíva “hmlu vojny” na stmavenie mapy, čo prenasledovateľovi sťaží odhalenie a zničenie evadera, no podľa výskumu ide o režim 1V1.

Vtipné, ale základné správanie 25Stratégiou Dodgers je zostať na mieste, kdekoľvek sa objavia, a potom na mieste zaútočiť na svojich prenasledovateľov. Keďže prenasledovatelia sú oveľa silnejší ako úhybníci, výsledkom je očakávané zničenie každého úskoku ihneď po odhalení.

Perspektívy

Huangov článok podrobne popisuje paradigmuŠkolenie AI v prostredí SCII, ktoré sa zameriava na výučbu AI vyhýbať sa prenasledovateľom. V ich verzii sa AI snaží skryť v „vojnovej hmle“, aby sa vyhla zajatiu a smrti.

Toto je fascinujúce použitie štúdievideohry, ktoré by mohli mať obrovské dôsledky pre skutočný svet. Najvyspelejšie vojenské organizácie na svete využívajú videohry na výcvik ľudí. A vývojári AI používajú tieto vzdelávacie prostredia na prípravu mozgu AI na život v skutočnom robote.

Čisto teoreticky sa zdá, že Huangova prácavzrušujúce. Ale len si predstavte robota Boston Dynamics, ktorý má schopnosť nielen behať a skákať po mieste, ale aj cieľavedome sa vyhýbať prenasledovaniu jednotky špeciálnych síl.

Zdroj: arxiv, deepmind, thenextweb

Ilustrácie: goodfon

</ p>