
Een wetenschapper van de Universiteit van Peking publiceerde onlangs een voordruk van een wetenschappelijk artikel waarin dit wordt beschreven
Wat is de essentie
Het meeste onderzoek in het genre“achtervolging-vermijding” in AI en speltheorie houden zich bezig met het leren van machines om de ruimte te verkennen. Omdat de meeste AI-trainingen een systeem omvatten dat de machine beloont voor het bereiken van een doel, gebruiken ontwikkelaars gamificatie vaak als stimulans om te leren.
Met andere woorden: je kunt niet zomaar een robot in een kamer zetten en zeggen ‘doe dit’. Je moet hem doelen geven en een reden om ze te bereiken. Daaromonderzoekers ontwikkelen AI die van nature probeert te belonen.
De traditionele uitdagingen voor de trainingsomgeving voor inlichtingenEen AI-agent heeft de taak digitale modellen te manipuleren om de ruimte te verkennen totdat hij zijn doelen bereikt of een beloning vindt. Het doet denken aan Pac Man: de AI moet door de omgeving bewegen totdat hij alle beloningspellets heeft opgegeten.
Geschiedenis van het probleem
Sinds de AI-systemen van DeepMindschaken en go onder de knie had, werd SCII de belangrijkste trainingsomgeving voor competitieve AI. Het is een spel waarin spelers, AI, of combinaties van spelers en AI van nature tegenover elkaar staan.
Maar nog belangrijker, DeepMind en anderenonderzoeksorganisaties hebben al het harde werk gedaan om de broncode van de game om te zetten in een AI-speeltuin met verschillende minigames waarmee ontwikkelaars zich op hun werk kunnen concentreren.
Onderzoeker Xun Huang, de bovengenoemde wetenschappervan de Universiteit van Peking, wilde het ‘achtervolgings-ontduikingsparadigma’ bestuderen. voor het trainen van AI-modellen. Maar ik ontdekte dat het SCII-model enkele beperkende beperkingen heeft: in de ingebouwde versie van het spel is “pursuit-evasion” De controle over achtervolgers kan alleen aan AI worden toevertrouwd.

De basisregeling omvat drie achtervolgingenpersonage (vertegenwoordigd door de soldaten uit het spel) en 25 ontwijkende personages (vertegenwoordigd door de aliens uit het spel). Er is ook een modus die gebruik maakt van “mist van de oorlog” om de kaart donkerder te maken, waardoor het voor de achtervolger moeilijk wordt om de ontduiker te detecteren en te vernietigen, maar volgens onderzoek is dit een 1V1-modus.
Grappig maar fundamenteel gedrag 25De strategie van Dodgers is om stil te blijven waar ze ook verschijnen en vervolgens hun achtervolgers ter plekke aan te vallen. Omdat de achtervolgers veel sterker zijn dan de ontduikers, resulteert dit in de verwachte vernietiging van elke ontduiker onmiddellijk na detectie.
Perspectieven
Huangs artikel beschrijft het paradigma in detailAI-training in de SCII-omgeving, die zich richt op het leren van AI om achtervolgers te ontwijken. In hun versie probeert de AI zich te verstoppen in de ‘mist van de oorlog’ om gevangenneming en dood te voorkomen.
Dit is een fascinerend onderzoek waarbij gebruik wordt gemaakt vanvideogames die enorme gevolgen kunnen hebben voor de echte wereld. De meest geavanceerde militaire organisaties ter wereld gebruiken videogames om mensen te trainen. En AI-ontwikkelaars gebruiken deze leeromgevingen om AI-breinen voor te bereiden op het leven in een echte robot.
Puur theoretisch lijkt het werk van Huangspannend. Maar stel je een Boston Dynamics-robot voor, die niet alleen over het terrein kan rennen en springen, maar ook doelbewust de achtervolging door een speciale eenheid kan ontwijken.
Bron: arxiv, deepmind, thenextweb
Illustraties: goedfon
</ p>