
מדען מאוניברסיטת פקין פרסם לאחרונה הדפסה מוקדמת של מאמר מדעי המפרט
מה המהות
רוב המחקרים בז'אנר“מרדף-הימנעות” ב-AI ותורת המשחקים עוסקים בהוראת מכונות לחקור את החלל. מכיוון שרוב אימון הבינה המלאכותית כולל מערכת שמתגמלת את המכונה על השגת מטרה, מפתחים משתמשים לעתים קרובות ב-gamification כתמריץ ללמידה.
במילים אחרות, אתה לא יכול פשוט לתקוע רובוט בחדר ולהגיד “עשה זאת”. אתה חייב לתת לו מטרות וסיבה להשיג אותן. בגלל זהחוקרים מפתחים AI שמטבעו מבקש לתגמל אותו.
אתגרי סביבת אימון המודיעין המסורתיתעל סוכן בינה מלאכותית מוטלת המשימה לתמרן מודלים דיגיטליים כדי לחקור את החלל עד שהוא ישלים את מטרותיו או ימצא פרס. זה מזכיר את Pac Man: הבינה המלאכותית חייבת לנוע בסביבה עד שהיא אוכלת את כל כדורי התגמול.
היסטוריה של הנושא
מאז מערכות ה- AI של DeepMindשליטה בשחמט ולך, SCII הפכה לסביבת האימון העיקרית של AI תחרותי. זהו משחק שבו שחקנים, AI, או צירופי שחקנים ו- AI מתנגדים זה לזה באופן טבעי.
אך חשוב מכך, DeepMind ואחריםארגוני מחקר כבר עשו את העבודה הקשה של הפיכת קוד המקור של המשחק למגרש משחקים מלאכותי עם מספר משחקי מיני המאפשרים למפתחים להתמקד בעבודתם.
החוקר Xun Huang, המדען הנ"למאוניברסיטת פקין, יצא לחקור את “פרדיגמת המרדף-התחמקות” לאימון דגמי AI. אבל גיליתי שלמודל SCII יש כמה מגבלות מגבילות: בגרסה המובנית של המשחק “מרדף-התחמקות” השליטה ברודפים יכולה להיות מופקדת רק על AI.

התוכנית הבסיסית כוללת שלושה רודפיםדמות (מיוצגת על ידי החיילים מהמשחק) ו-25 דמויות מתחמקות (מיוצגות על ידי החייזרים מהמשחק). יש גם מצב שמשתמש ב“ערפל מלחמה” להחשיך את המפה, מה שמקשה על הרודף לזהות ולהשמיד את המתחמק, אבל לפי מחקר, מדובר במצב 1V1.
התנהגות מצחיקה אך בסיסית 25האסטרטגיה של הדודג'רס היא להישאר נייחים בכל מקום שבו הם מופיעים ואז לתקוף את הרודפים שלהם במקום. מכיוון שהרודפים הרבה יותר חזקים מהמתחמקים, הדבר מביא להרס הצפוי של כל מתחמק מיד עם גילויו.
פרספקטיבות
המאמר של הואנג מתאר את הפרדיגמה בפירוטאימון בינה מלאכותית בסביבת SCII, המתמקדת בלימוד בינה מלאכותית כדי להתחמק מרודפים. בגרסתם, הבינה המלאכותית מנסה להסתתר ב"ערפל המלחמה" כדי להימנע מלכידה ומוות.
זהו מחקר מרתק באמצעותמשחקי וידאו שיכולים להיות להם השלכות עצומות על העולם האמיתי. הארגונים הצבאיים המתקדמים בעולם משתמשים במשחקי וידאו כדי להכשיר אנשים. ומפתחי בינה מלאכותית משתמשים בסביבות הלמידה הללו כדי להכין מוחות בינה מלאכותית לחיים בתוך רובוט אמיתי.
באופן תיאורטי בלבד, עבודתו של הואנג נראיתמְרַגֵשׁ. אבל רק תארו לעצמכם רובוט של בוסטון דינמיקס, שניחן ביכולת לא רק לרוץ ולקפוץ ברחבי האתר, אלא להתחמק בכוונה מרדף על ידי חוליית כוחות מיוחדים.
מקור: arxiv, deepmind, thenextweb
איורים: goodfon
</ p>