
Znanstvenik sa Sveučilišta u Pekingu nedavno je objavio preprint znanstvenog članka s detaljima
U čemu je bit
Većina studija u žanru“potjera-izbjegavanje” u umjetnoj inteligenciji i teoriji igara bave se učenjem strojeva da istražuju svemir. Budući da većina AI obuke uključuje sustav koji nagrađuje stroj za postizanje cilja, programeri često koriste igrifikaciju kao poticaj za učenje.
Drugim riječima, ne možete jednostavno staviti robota u sobu i reći 'učini ovo”'. Morate mu dati ciljeve i razlog da ih postigne. Zatoistraživači razvijaju AI koju po svojoj prirodi nastoji nagraditi,
Izazovi tradicionalnog okruženja za obuku inteligencijeAI agent ima zadatak manipulirati digitalnim modelima kako bi istraživao svemir dok ne ispuni svoje ciljeve ili ne pronađe nagradu. Podsjeća na Pac Mana: AI se mora kretati okolinom dok ne pojede sve nagradne kuglice.
Povijest problema
Još od AI sustava DeepMindsvladao šah i idi, SCII je postao primarno okruženje za obuku natjecateljske umjetne inteligencije. To je igra u kojoj se igrači, umjetna inteligencija ili kombinacije igrača i umjetna inteligencija prirodno suprotstavljaju.
No, još važnije, DeepMind i drugiistraživačke organizacije već su učinile naporan posao pretvaranja izvornog koda igre u AI igralište s nekoliko mini igara koje razvojnim programerima omogućuju da se usredotoče na svoj rad.
Istraživač Xun Huang, spomenuti znanstveniksa Sveučilišta u Pekingu, krenuo je proučavati “paradigmu izbjegavanja potjere” za obuku AI modela. No otkrio sam da SCII model ima neka ograničavajuća ograničenja: u ugrađenoj verziji igre “pursuit-evasion” Kontrola nad progoniteljima može se povjeriti samo AI.

Osnovna shema uključuje tri gonjenjalik (koga predstavljaju vojnici iz igrice) i 25 likova bježača (koga predstavljaju vanzemaljci iz igrice). Postoji i mod koji koristi “maglu rata” za zamračivanje karte, što otežava progonitelju otkrivanje i uništavanje bježača, ali prema istraživanju, ovo je 1V1 način rada.
Smiješno, ali osnovno ponašanje 25Dodgersova strategija je da ostanu nepomični gdje god se pojave, a zatim napadnu svoje progonitelje na licu mjesta. Budući da su progonitelji mnogo jači od onih koji bježe, to rezultira očekivanim uništenjem svakog bježača odmah po otkrivanju.
planovi
Huangov članak detaljno opisuje paradigmuObuka umjetne inteligencije u SCII okruženju, koja se usredotočuje na učenje umjetne inteligencije kako izbjeći progonitelje. U njihovoj verziji, AI se pokušava sakriti u "magli rata" kako bi izbjegao zarobljavanje i smrt.
Ovo je fascinantna studija koja koristivideo igre koje bi mogle imati ogromne implikacije na stvarni svijet. Najnaprednije svjetske vojne organizacije koriste se videoigricama za obuku ljudi. A AI programeri koriste ova okruženja za učenje kako bi pripremili AI mozgove za život unutar pravog robota.
Čisto teoretski, Huangov se rad činiuzbudljiv. Ali samo zamislite robota Boston Dynamicsa, obdarenog sposobnošću ne samo da trči i skače po gradilištu, već i da namjerno izbjegne potjeru odreda specijalnih snaga.
Izvor: arxiv, deepmind, thenextweb
Ilustracije: goodfon
</ p>