Відмінні новини: вчені навчили ІІ техніці ухилення від переслідування

Вчений із Пекінського університету нещодавно опублікував препринт наукової статті, в якій докладно описано

система, заснована на відеоіграх, призначена для навчання носіїв ІІ можливості уникати переслідування.

В чому суть

Більшість досліджень у жанрі“переслідування-уникнення” в області ІІ та теорії ігор пов'язані з навчанням машин дослідженню простору. Оскільки в більшості випадків навчання ІІ передбачає систему, яка винагороджує машину за досягнення мети, розробники часто використовують гейміфікацію як стимул для навчання.

Іншими словами, не можна просто засунути робота в кімнату і сказати "роби те-то". Ви повинні дати йому цілі та причину для їх досягнення. Томудослідники розробляють ІІ, який за своєю природою прагне до винагороди.

Традиційне середовище навчання розвідці ставить передагентом ІІ завдання маніпулювати цифровими моделями, щоб дослідити простір, доки він не виконає своєї мети чи знайде винагороду. Це нагадує Pac Man: ІІ повинен переміщатися по оточенню доти, доки не з'їсть усі гранули з винагородою.

Історія питання

З тих пір як системи ШІ компанії DeepMindосвоїли шахи і го, SCII стала основною тренувальною середовищем для змагального ІІ. Це гра, в якій гравці, ІІ або комбінації гравців і ІІ природним чином протистоять один одному.

Але, що більш важливо, DeepMind і іншідослідні організації вже виконали важку роботу по перетворенню вихідного коду гри в ігровий майданчик для ІІ з декількома міні-іграми, які дозволяють розробникам зосередитися на своїй роботі.

Дослідник Сюнь Хуанг, вищезгаданий вченийз Пекінського університету, поставив за мету вивчити парадигму “переслідування-ухилення” для навчання моделей ІІ. Але виявив, що модель SCII має деякі стримуючі обмеження: у вбудованій версії гри "переслідування-ухилення"; управління переслідувачами можна доручити лише ІІ.

Основна схема включає три переслідуючихперсонажа (представлених солдатами з гри) та 25 персонажів-уклоністів (представлених прибульцями з гри). Існує також режим, що використовує "туман війни". для затемнення карти, що ускладнює переслідувачу виявлення та знищення ухиліста, але, згідно з дослідженнями, це режим 1V1.

Кумедно, але базова поведінка 25ухилістів полягає в тому, щоб залишатися нерухомими, де б вони не з'явилися, а потім атакувати переслідувачів на місці. Оскільки переслідувачі набагато сильніші за тих, хто ухиляється, це призводить до очікуваного знищення кожного, хто ухиляється відразу після виявлення.

перспективи

У статті Хуанга докладно описується парадигманавчання ІІ в середовищі SCII, яка фокусується на навчанні ІІ ухилятися від переслідувачів. У їхній версії ІІ намагається сховатися в "тумані війни", щоб уникнути затримання і загибелі.

Це цікаве дослідження з використаннямвідеоігор, які можуть мати величезні наслідки для реального світу. Найбільш передові військові організації світу використовують відеоігри для навчання людей. А розробники ІІ використовують ці навчальні середовища для підготовки мозку ІІ до життя всередині реального робота.

Чисто теоретично робота Хуанга здаєтьсязахоплюючою. Але тільки уявіть собі робота Boston Dynamics, наділеного здатністю не просто бігати і стрибати по майданчику, а цілеспрямовано йти від переслідування загоном спецназу.

Джерело: arxiv, deepmind, thenextweb

Ілюстрації: goodfon

</ P>