Gode ​​nyheter: Forskere lærer AI -teknikker for å unngå jakt

En vitenskapsmann fra Peking University publiserte nylig et fortrykk av en vitenskapelig artikkel med detaljer

et videospillbasert system designet for å trene AI-verter til å unngå jakten.

Hva er essensen

De fleste studier i sjangeren“forfølgelse-unngåelse” i AI og spillteori er opptatt av å lære maskiner å utforske verdensrommet. Siden det meste av AI-trening involverer et system som belønner maskinen for å oppnå et mål, bruker utviklere ofte gamification som et insentiv for læring.

Med andre ord, du kan ikke bare stikke en robot inn i et rom og si “gjør dette”. Du må gi ham mål og en grunn til å oppnå dem. Derforforskere utvikler AI som i sin natur søker å belønne.

Det tradisjonelle etterretningstreningsmiljøet utfordrerEn AI-agent har i oppgave å manipulere digitale modeller for å utforske verdensrommet til den fullfører sine mål eller finner en belønning. Det minner om Pac Man: AI-en må bevege seg rundt i miljøet til den spiser opp alle belønningspelletene.

Problemets historie

Helt siden DeepMinds AI -systemermestret sjakk og gå, SCII ble det primære treningsmiljøet for konkurransedyktig AI. Det er et spill der spillere, AI eller kombinasjoner av spillere og AI naturligvis motsetter hverandre.

Men enda viktigere, DeepMind og andreforskningsorganisasjoner har allerede gjort det harde arbeidet med å gjøre spillets kildekode til en AI -lekeplass med flere minispill som lar utviklere fokusere på arbeidet sitt.

Forsker Xun Huang, den nevnte forskerenfra Peking University, satte seg fore å studere “pursuit-evasion paradigm” for trening av AI-modeller. Men jeg oppdaget at SCII-modellen har noen begrensende begrensninger: i den innebygde versjonen av spillet “pursuit-evasion” Kontroll over forfølgere kan bare overlates til AI.

Grunnordningen inkluderer tre forfølgendekarakter (representert av soldatene fra spillet) og 25 unnvikerkarakterer (representert av romvesenene fra spillet). Det finnes også en modus som bruker “krigståke” å gjøre kartet mørkere, noe som gjør det vanskelig for forfølgeren å oppdage og ødelegge unnvikeren, men ifølge forskning er dette en 1V1-modus.

Morsom, men grunnleggende oppførsel 25Dodgers strategi er å holde seg stille uansett hvor de dukker opp og deretter angripe forfølgerne på stedet. Siden forfølgerne er mye sterkere enn unnvikerne, resulterer dette i forventet ødeleggelse av hver unnviker umiddelbart etter oppdagelse.

Perspektiver

Huangs artikkel beskriver paradigmet i detaljAI-trening i SCII-miljøet, som fokuserer på å lære AI for å unngå forfølgere. I deres versjon prøver AI å gjemme seg i "krigens tåke" for å unngå fangst og død.

Dette er en fascinerende studie som brukervideospill som kan ha enorme implikasjoner for den virkelige verden. Verdens mest avanserte militærorganisasjoner bruker videospill for å trene folk. Og AI-utviklere bruker disse læringsmiljøene til å forberede AI-hjerner for livet i en ekte robot.

Rent teoretisk virker Huangs arbeidspennende. Men bare forestill deg en Boston Dynamics-robot, utstyrt med evnen til ikke bare å løpe og hoppe rundt på stedet, men målrettet unngå forfølgelse av en spesialstyrkegruppe.

Kilde: arxiv, deepmind, thenextweb

Illustrasjoner: goodfon

</ p>