"Лесно е да се увеличи с 20%, ако сте открили един и половина повече магазини"
— В речта си ти
— Оборотът на X5 ще продължи да расте.Като цяло пазарът върви към консолидация в търговията на дребно. В момента нашите три водещи търговци на дребно заемат приблизително 20% от пазара, а в развитите капиталистически страни виждаме, че този дял ще бъде около 70–75%.
Средно всеки ден X5 отваря шест новимагазини. Докато говорим, X5 отваря нов магазин (смее се). Всъщност нещата вървят добре, за разлика от някои други участници на пазара. Ако погледнете отворените данни, едната от тях, с увеличение на площта от 12%, оборотът се е увеличил само с 84%. Лесно е да се изчисли: те започват да работят негативно. Има такъв индикатор, LFL - Като за сравнение, сравнение на същите магазини годишно. В X5 на него, макар и малък, но плюс. Това означава, че не е трудно да се увеличи с 20%, ако сте открили един и половина повече магазини, но това всъщност е отрицателен ръст. Ако пораснете поради факта, че старите магазини работят по-добре и се отварят нови, то това е доста положително.
- Какво мислите, каква е ползата от екипа ви в това?
— Все още не е много голям, защото екипътформирана не толкова отдавна. Нека бъдем честни, растежът на X5 през 2017 г. е малко вероятно да се дължи на нашето приложение за анализ на данни с помощта на екип, създаден през 2018 г.
Ръководителят на нашата дирекция е Антон Мироненков, човек, участвал в създаването на компанията X5. Той участва в сливането на Perekrestok и Pyaterochka, след което се появява X5.
Разглеждаме посоката на големите даннистратегически. Бъдещето на търговията на дребно зависи от това колко бързо търговците на дребно се научават да монетизират и използват данните, които генерираме в големи количества всеки ден, за да оптимизираме процесите и да подобрим изживяването на клиентите. Затова решихме да отделим всичко това в отделно направление и да му дадем по-голям фокус, за да се развива по-бързо.

Антон Мироненков, началник на дирекция "Големи данни" Х5
В рамките на тази дирекция имаме собствен капацитет,клъстер, разработчици, тестери, анализатори, проекти, продукти - всичко, от което се нуждаете. Вече направихме някои неща и това е голям напредък за по-малко от година. Ние ясно разбираме, че ще дадем на компанията доста голяма печалба, но отново, тези резултати ще бъдат видими само след една година.
Цялата информация в чека - ако сте закупили водка, тогава сте на възраст над 18 години.
- Ако дойда на "Кръстопът" и направя покупка, какво от всичко това ще вземете за анализ?
- Проверете. Вашите продукти ви характеризират доста добре. Ако купувате пелени, вероятно имате малко дете. Ако сте водка, тогава сте на възраст над 18 години. Човек може да си купи чипове и ще бъде с определена вероятност тийнейджър от 16 години. И ако сте си купили дневник, тогава вие или вашето семейство имате дете от 7 до 17 години. Това е много информация.
Представете си: дойдете в магазина, погледнете някои продукти и разберете, че магазинът е скъп, евтин или средно ценови клас. В Пятерочка има от 4 до 8 хиляди уникални продукта. Малко вероятно е да отидете с тетрадка и да запишете цените за целия набор от стоки, а след това да видите средните цени на стоките в града и да направите заключение. Просто погледнете пет-десетте продукта. И така, какви продукти гледате, ние също сме ангажирани.
Продуктите, които хората гледат, също се променят спо време. Един прост пример: преди 20 години нямаше продукти, свързани с мобилните комуникации. Сега можете, не във всички магазини, а да си купите SIM карта. Преди 20 години в Русия имаше обикновено пъти по-трудно, отколкото сега, а потреблението беше съвсем различно.
- Как се създават профили на клиентите, за да им се предлагат отстъпки?
- Има два продукта: клиентски профил и лоялност. Профил на клиент е такава задача, когато не разполагате с някаква маркировка и използвате различни подходи. Ние използваме различни подходи за клъстеризиране - като се започне от стандартната статистика, изчисляваме някои Z-скорости, силни отклонения от медианата и завършваме с Word2vec, наслагвайки се на проверки и „превеждайки“ човек във векторния тип, осреднен чрез TF-IDF над Word2vec.
Z-резултат, Z-резултат- статистическа оценка, която изразяваРазстоянието (измерено като стандартно отклонение) на дадено ниво от средната стойност на набора от данни. По-специално, Z-резултатът е изходен индикатор за кредитоспособността на компанията и степента на нейния риск от фалит.
Здрави отклонения от английския. Здрава, стабилна е стабилността на оценките по отношение на емисиите в данните. Считано по отношение на медианата.
Word2vecе инструмент, който ви позволява да представяте думи като вектори.
TF-IDF- термин в статистиката, обозначаващ степента на важност на дадена дума в корпус от текстове.
Ако имате някакъв модел, който правикато лично предложение, тогава нека приемем, че клъстеризацията е успешна, ако след добавяне на атрибути качеството на моделите се подобри. Тук можете да изчислите икономическия ефект и някакъв вид метрика.
- В каква част от магазините се използват вашите продукти?
- Във всичко.Тествахме персонализираната отстъпка на половин милион потребители, за да разберем ефекта й във всичките 14 хиляди магазина на X5. Ние събираме интерактивни отчети от всички тези магазини. Имаме промоционален продукт, който се предлага във всички магазини. Имаме асортиментна матрица, имаме прогноза за търсенето. Гледат, първо, да има пиле в магазина и, второ, пилето да не е гнило.
Сега нека започнем да правим компютърно зрениепървоначално няма да се предлага във всички магазини. Да започнем с най-големите - има смисъл да тестваме само в тях. Задачата е съвсем проста, ползите са ясни. Има продукт, може да не е на рафта, но може да лежи в склада и в този момент продуктът не е закупен. Това е много лошо. Магазинът го купи, но не може да го продаде. В най-добрия случай потребителят няма да купи продукта, а в най-лошия ще се обърне и ще си тръгне, защото не е нужно да идва там, където ще купи два от трите продукта, а да отиде в друг магазин за третият. Той ще дойде направо в магазина, където може да купи всичко. И това се решава с помощта на компютърно зрение. Поставя се камера и тя открива, че ви е останал малко продукт. Пристига известие до лицето, което отговаря за това, той отива в склада, за да купи този продукт.
Втората задача е редът. Знаем, че имаме опашка в магазина. Или сте в ред, не сте доволни и губите време, което никой не харесва, или отидете до магазина, погледнете опашката, обърнете се и си тръгнете. Ако причината за опашката е, че държавата не разполага с достатъчно персонал, не може да се направи нищо по въпроса. И ако проблемът е, че условната продавачка седи в задната стая, почива и пие чай, а режисьорът я извиква. Магазинът вече е в ред, и докато не достигне, седи на компютъра, го включва, започва да дърпа касиера, времето ще мине. Все още гледайки я, тя е нервна, хората също. Този касиер трябва да излезе преди да се формира опашката, така че до момента на излизане хората вече са отишли в касиера. Това е доста лесно да се реши с помощта на компютърно зрение.
Ще го тестваме на около 150магазини и най-вероятно в Москва. Първо, ние самите сме в Москва и второ, тук има повече трафик. Тогава ще стане ясно как да подобрим потребителското изживяване и каква е ползата от X5.
- Наистина не харесвам учения за данни.
- Разширявате ли управлението си?
- Разбира се, мениджърите виждат, че даваме резултати. Никой не ви позволява да разширите екипа два пъти, ако не работите добре. Сам по себе си този факт говори за нашата ефективност.
- Казахте, че имате 32 души, които работят, колко повече ще наемате?
- Все още някъде 20-30. Сега ще използваме компютърна визия и технология на речта като част от управлението ми. Ще има два нови отдела, т. Е. Това е плюс десет души, според мен още 10-15 са договорени за следващата година. Има така наречените проектни ставки. Очакваме да бъде 30–36 плюс, някъде над 60 души. Това са именно хората, които се занимават с анализ на данни и машинно обучение.
- Кой приканваш да работиш?
— Наистина не харесвам думата „учен по данни“защото не носи никаква информация. Можете да дойдете в десет компании, където търсят учен по данни, и това ще бъдат десет напълно различни позиции. Харесвам думата "аналитик". Имената на моите отдели говорят сами за себе си: има отдел за машинно обучение, отдел за анализ на данни, група за научноизследователска и развойна дейност, тоест изследователска дейност, отдел за компютърно зрение, отдел за речеви технологии и група за непродуктов анализ за решаване на тези проблеми които излизат извън която и да е съществуваща продуктова посока.
Търся хора, които могат да програмиратPython, познават теорията на вероятностите и математическата статистика, ако се нуждая от моделиране, тогава са необходими умения за машинно обучение. Но най-важното е способността на човек да мисли и анализира. Все по-често стигам до идеята, че аналитичното мислене и критичното е много трудно да се преподава. Ако до 20-25 години вече има някакъв мироглед, то е малко вероятно да се промени.
- Разбрахте ли това в X5?
- Не че Х5 ме доведе до това. Аз също гледам на хората, общувам, виждам как работят. Както знаете, най-доброто интервю е пробен период. И в един момент виждате, че това просто не е за този човек. Това означава, че изглежда, че той е завършил mekhmat, изглежда той не е глупак, но не и той. Няма правилно отношение, не виждам неща. Беше в книгата на Даниел Канеман „Мислене, бързо и бавно“, където той описа какво съответства на критичното мислене. Това включва песимистичен поглед към света и е по-скоро вродено качество, отколкото придобито, за съжаление или за щастие.
- Ако пристигне анализатор и след пробен период разбирате, че той е подходящ, какво може да очаква човек?
- Стандартно в ИТ има степени - младша, средна,старши и стажант. Рядко се среща по-горе - това е персоналът или лидерът. Смятам, че има инфлация на висшата позиция: имаме много от тях, но всъщност рядко достигат средната средна позиция.
Ако вземете средната заплата на пазара, младшиполучава някъде между 120-150 хиляди рубли преди данъци на месец, средно - до 250 000. Старши около 400 хиляди рубли. Top bar: Аз лично държах офертата в ръцете си на водещия разработчик, тя беше повече от 600 хиляди рубли.
„Наука за данните е наистина нещо като„ череша на торта ”“
— Как започнахте да се занимавате с машинно обучение?
— В университета изобщо нямаше компютърни науки.обучение. Тъй като завърших университет през 2012 г., горе-долу по същото време имаше друг възход на нещата, свързани с това. Нямах време. Завършил два университета, последното е Университета за приложни науки в Карлсруе, магистърска степен по мехатроника. Преди това той учи в Московския институт по инженерна химия, сега наречен Московска политехника. Не съм участвал в машинно обучение нито там, нито там.
Странно нещо: Сега тези, които завършват науката за данните, са интервюирани, и изглежда, че тяхното ниво е по-слабо и по-ниско от това на онези момчета, които са завършили физика, инженерство, компютърни науки, и след това машинното обучение е “наранило” върху него. Може би това е лека промяна, защото момчетата, които са я научили сами, първоначално са били силни, научили нещо ново и дошли. И науката за данните е наистина някаква „череша на торта“, а ако няма самата „торта“, но има „череша“, това не е толкова интересно.
- Как научихте това?
— Има една стара поговорка, че в Coursera има двамасериозен курс, дори един и половина. Това е курсът на Хинтън за машинно обучение и невронни мрежи (курсът вече не е достъпен в Coursera, но може да се гледа в YouTube - Hi-Tech) и курсът на Дафни Колър за вероятностни неграфични модели.
Курсът на Коллер е видеозапис на лекции,която тя чете на студенти в Станфорд. Ето защо, да го наречем не съвсем сериозно, не превръща езика. Курсът на Hinton продължава 16 седмици, а Koller има три курса от пет до шест седмици. Събрах силата в юмрук, премина през първия курс и разбрах, че вторият и третият не са готови да минат.
Но Coursera не е единствената опция.Четох много книги. Между другото, сега завърших книгата на Брадли Ефрон за статистиката (американски статистик, носител на Националния медал на честта на САЩ - най-високото държавно отличие за американски учени - "High-Tech"). Преди това книга от Иън Годфелоу (американски специалист по машинно обучение, работи в Google Brain - Hi-Tech) за дълбокото обучение. Това е непрекъснат процес на обучение. Coursera е само един ресурс, Kaggle (онлайн общност за компютърни науки, която редовно организира състезания - "High-Tech") е друг, но основното е да четете, четете, четете и проверявате. Ако го прочетете и не го разберете, това е лошо. Ако разбирате как работи, можете да направите всичко.
Това е като таблицата за умножение.Представете си, че човек не разбира таблицата за умножение, но я е научил наизуст. Питат го: "Шест на шест?" - „36“. - "Седем на осем?" - „56“. - „Добре, последен въпрос, 10 до 11?“ — Човекът казва: „Не знам, не беше в таблицата за умножение.“ Това е. Това са хората, които често срещам. 10 на 11 е много по-лесно за изчисляване, но това не е в таблицата, трябва да разберете принципа. Ако разберете принципите, тогава всичко ще бъде много по-лесно.
Всичко останало зависи от човека. Изглежда, че ние научаваме нещо. Ние само помагаме и не се намесваме с други хора. Всичко това е въпрос на самодисциплина.
— Разкажете ни за вашия курс по наука за данни в HSE.
- Това е безплатен курс, той е в рамките на стандартаразказвам за основните прости неща, които за много хора - откровение. Например, какви са показателите, защо те изобщо съществуват, как се различават помежду си, в кои случаи е необходимо, как да тествате идеята си за това, какво е А / Б тест. Ето това изкарах за себе си, че е важно хората да знаят и какво в действителност имат нужда от работата си.
- Как виждате бъдещето на търговията на дребно след пет до десет години?
— Ако говорим за търговия на дребно с храни, тогаваФорматът хипермаркет ще отмре. Това се вижда сега в Щатите, как умират големите търговски центрове там, а между другото и в Русия. Какъв беше моделът на потребление преди? Отиваме в мола, на кино, в заведението за хранене и купуваме нещо друго. Сега се прибираме, ivi, Okko, Netflix, Yandex.Eda, Delivery Club, доставка от ресторант, онлайн пазаруване. Трябва да преминем към персонализация.
- Какво ще означава това за потребителя?
- Човек използва какво? Това, което той може да си позволи и това е удобно за него. Следователно е необходимо да се намалят разходите, да се запази същото качество или да се увеличи. Това е мястото, където персонализация идва на ум.
- Човек купува това, което може да си позволи. Сега реалните доходи на населението намаляват, разходите намаляват.
— В такава ситуация съхранявайте икономични форматисе чувстват по-добре и растат. Има два начина за решаване на много проблеми за търговците на дребно. Или автоматизация, или наемете още десет души. В краткосрочен план вторият начин е печеливша стратегия, тъй като интеграцията е скъпа, отнема време и ако нещо се обърка, можете да загубите бонуса си. Сега си представете, че сте директор на отдел с много голям бонус и може да го загубите. Не е ясно дали ще работите във фирмата след две години, когато станат известни резултатите от тази автоматизация, или не и ще ви хвалят за тях. И може би вече имате бонус. Затова наемаме още десет души. Но това води до голяма загуба в дългосрочен план.