Hur datorsyn kommer att vinna köer och tomma hyllor i stormarknader - Valery Babushkin, X5 Retail Group

"Det är lätt att växa med 20% om du har öppnat en och en halv gånger fler butiker"

— I ert anförande

sa att X5 Retail Groups intäkter nådde 1,286 biljoner rubel 2017, och minskningen av kostnaderna med även en liten andel leder tillHur expanderar X5?

— X5:s omsättning kommer att fortsätta att öka.Generellt strävar marknaden efter konsolidering inom detaljhandeln.Vi har tre ledande detaljhandlare som upptar omkring 20 procent av marknaden, och vi ser i de utvecklade kapitalistiska länderna att denna andel kommer att varacirka 70–75 %.

Varje dag i genomsnitt öppnar X5 sex nyabutiker. Medan vi pratar öppnar X5 en ny butik (skrattar). Det går faktiskt bra, till skillnad från andra marknadsaktörer. Om du tittar på den öppna data, en av dem, med en ökning i området 12%, ökade omsättningen med endast 84%. Det är lätt att beräkna: de börjar fungera negativt. Det finns en sådan indikator, LFL - Liksom för en jämförelse av samma butiker ett år. På X5 på den, men liten, men ett plus. Det är lätt att växa med 20% om du har öppnat en och en halv gånger fler butiker, men det här är en negativ tillväxt i själva verket. Om du växer upp på grund av att gamla butiker fungerar bättre och nya är öppna så är det ganska positivt.

- Vad tycker du, vilken andel av dina lagers fördelar i detta?

— Det är inte så stort än, eftersom laget bildades för inte så länge sedan.Låt oss vara ärliga, X5:s tillväxt under 2017 kommer sannolikt inte att drivas av det faktum att vi tillämpar dataanalys med ett team som skapades 2018.

Chefen för vårt direktorat är Anton Mironenkov, en man som deltog i skapandet av X5-företaget. Han var involverad i sammanslagningen av Perekrestok och Pyaterochka, varefter X5 dök upp. 

Vi överväger riktningen för big datastrategisk. Framtiden för detaljhandeln beror på hur snabbt återförsäljare lär sig att tjäna pengar och använda den data som vi genererar i ganska stora mängder varje dag för att optimera processer och förbättra kundupplevelsen. Därför bestämde vi oss för att separera allt detta i en separat riktning och ge det större fokus så att det utvecklas snabbare.

Anton Mironenkov, chef för Big Data Directorate X5

Inom detta direktorat har vi vår egen kapacitet,kluster, utvecklare, testare, analytiker, projekt, produkter - allt du behöver. Vi har redan gjort en del saker, och det här är stora framsteg under mindre än ett år. Vi förstår tydligt att vi kommer att ge företaget en ganska stor vinst, men återigen kommer dessa resultat att synas först om ett år.

All information i kontrollen - om du köpte vodka, då är du över 18 år.

- Om jag kommer till "Crossroads" och köper, vad av allt kommer du att ta för analys?

- Kontrollera. Dina produkter kännetecknar dig ganska bra. Om du köper blöjor har du förmodligen ett litet barn. Om vodka är du över 18 år gammal. En person kan köpa chips, och det kommer med viss sannolikhet att bli en tonåring på 16 år. Och om du har köpt en dagbok, då har du eller din familj ett barn från sju till 17 år. Det här är mycket information.

Tänk dig: du kommer till affären, tittar på några produkter och förstår att butiken är dyr, billig eller medelstora pris kategori. I Pyaterochka finns det 4-8 tusen unika produkter. Det är osannolikt att du går med en anteckningsbok och skriver ner priserna för hela uppsättningen varor och sedan tittar på de genomsnittliga priserna på varor i staden och drar en slutsats. Titta bara på de fem till tio produkterna. Och så vilka produkter du tittar på, vi är också engagerade.

Produkter som människor tittar på förändras också medmed tiden. Ett enkelt exempel: För 20 år sedan fanns inga produkter relaterade till mobilkommunikation. Nu kan du, inte i alla butiker, men köpa ett SIM-kort. För 20 år sedan i Ryssland var det i allmänhet lite svårare än nu, och konsumtionen var helt annorlunda.

- Hur är skapandet av kundprofiler att erbjuda dem rabatter?

- Det finns två produkter: kundprofil och lojalitet. En klientprofil är en sådan uppgift när du inte har någon markup och använder olika metoder. Vi använder olika sätt att klustra - utgående från standardstatistik, beräkna några Z-hastigheter, robusta avvikelser från medianen och sluta med Word2vec, överlagrade på kontroller och "översätta" en person till en typ av vektor som medelvärde genom TF-IDF över Word2vec.

Z-poäng, Z-poäng- en statistisk uppskattning som uttryckerAvståndet (mätt som standardavvikelse) för en given nivå från medelvärdet av datamängden. I synnerhet är Z-score ett outputmått på ett företags kreditvärdighet och dess risk för konkurs.

Robusta avvikelser från engelska. robust, "robust" är stabiliteten för uppskattningar med avseende på utsläpp i data. Betraktas i förhållande till medianen.

Word2vecär ett verktyg som låter dig representera ord som vektorer.

TF-IDF- en term i statistiken som anger graden av betydelse för ett ord i en korpus av texter.

Om du har någon modell som görett personligt förslag, låt oss anta att clustering är framgångsrik om man efter att ha lagt till attribut förbättrar kvaliteten på modellerna. Här kan du beräkna den ekonomiska effekten, och någon form av mätvärde.

- I vilken del av butikerna används dina produkter?

- I alla.Vi testade den personliga rabatten på en halv miljon användare för att förstå dess effekt i alla 14 tusen X5-butiker. Vi samlar in interaktiv rapportering från alla dessa butiker. Vi har en reklamprodukt som finns i alla butiker. Vi har en sortimentsmatris, vi har en efterfrågeprognos. De ser till att det dels finns kyckling i butiken och dels att kycklingen inte är ruttet.

Låt oss nu börja göra datorseende, detkommer inte att finnas i alla butiker till en början. Låt oss börja med de största - det är vettigt att bara testa i dem. Uppgiften är ganska enkel, fördelarna är tydliga. Det finns en produkt, den kanske inte finns på hyllan, men den kan ligga på lagret, och i det ögonblicket är produkten inte köpt. Det här är väldigt dåligt. Butiken köpte den, men kan inte sälja den. I bästa fall kommer användaren inte att köpa produkten, och i värsta fall kommer han att vända sig om och gå, eftersom han inte behöver komma dit han ska köpa två av de tre produkterna och gå till en annan butik för den tredje. Han kommer direkt till butiken där han kan köpa allt. Och detta löses med hjälp av datorseende. En kamera placeras och den känner av att du har lite produkt kvar. Ett meddelande kommer till den som ansvarar för detta, han går till lagret för att köpa denna produkt.

Den andra uppgiften är turnen. Vi vet att vi har en kö i butiken. Antingen står du i linje, missnöjd och slösar bort tid som ingen gillar, eller gå till affären, titta på köen, vänd och lämna. Om orsaken till kön är att staten är underbemannad, kan ingenting göras om det. Och om problemet är att den villkorliga säljaren sitter i bakrummet, vilar och dricker te, och regissören ringer henne. Butiken är redan i linje, och tills den når, sitter vid datorn, slås på den, börjar dra kassören, tiden kommer att passera. Hon tittar fortfarande på henne, hon är nervös, folk också. Den här kassan måste gå ut innan köen bildas, så att vid utgången har människor redan gått till kassan. Det är ganska enkelt att lösa med hjälp av datorsyn.

Vi kommer att testa den vid cirka 150butiker, och troligen i Moskva. För det första är vi själva i Moskva, och för det andra är det mer trafik här. Då blir det tydligt hur man kan förbättra användarupplevelsen och vad som är fördelen med X5.

"Jag gillar verkligen inte datatekniken".

- Expanderar du din förvaltning?

- Självklart ser chefer att vi ger resultat. Ingen tillåter dig att expandera laget två gånger om du inte arbetar bra. I själva verket talar detta om vår effektivitet.

- Du sa att du har 32 personer som arbetar, hur många fler kommer du att rekrytera?

- Fortfarande någonstans 20-30. Vi kommer nu att använda datasyn och talteknik som en del av min ledning. Det kommer att finnas två nya avdelningar, det vill säga det här är plus tio personer, enligt min mening är ytterligare 10-15 överens om nästa år. Det finns så kallade projektpriser. Vi förväntar oss att det ska vara 30-36 plus, någonstans över 60 personer. Dessa är specifikt de personer som är engagerade i dataanalys och maskininlärning.

- Vem inbjuder du till att arbeta?

— Jag gillar verkligen inte ordet "dataforskare"eftersom den inte innehåller någon information. Du kan komma till tio företag där de söker en datavetare och det blir tio helt olika tjänster. Jag gillar ordet "analytiker". Mina avdelningsnamn talar för sig själva: det finns en maskininlärningsavdelning, en dataanalysavdelning, en FoU-grupp, det vill säga forskning, en datorseendeavdelning, en talteknikavdelning och en icke-produktanalysgrupp för att lösa dessa problem som kommer utanför någon befintlig produktriktning.

Jag letar efter personer som kan programmera inPython, känner sannolikhetsteori och matematisk statistik, om jag behöver modellering, krävs maskininlärningsförmåga. Men det viktigaste är att en person kan tänka och analysera. Jag kommer alltmer till idén att analytiskt tänkande och kritiskt är något som är mycket svårt att undervisa. Om 20-25 år redan finns en del världsutsikt, är det osannolikt att förändras.

- förstod du detta i x5?

- Inte att X5 ledde mig till det här. Jag tittar också på människor, kommunicerar, ser hur de fungerar. Som du vet är den bästa intervjun en provperiod. Och vid något tillfälle ser du att det här helt enkelt inte är för den här personen. Det verkar som om han tog examen från mekhmat, det verkar som om han inte är en dåre, men inte han. Det finns ingen rätt attityd, ser inte saker. Det var i Daniel Kanemans bok "Tänkande, snabbt och långsamt", där han beskrev vad som motsvarar kritiskt tänkande. Detta inkluderar en pessimistisk syn på världen, och det är mer medfödd kvalitet än förvärvad, tyvärr eller lyckligtvis.

- Om en analytiker anländer och efter en försöksperiod förstår du att han är lämplig, vad kan en person förvänta sig?

- Standardmässigt finns det graderingar inom IT - junior, mellan,senior och praktikant. Det finns sällan ovan - det här är personalen eller ledaren. Jag tror att det finns en inflation av ledande positioner: vi har många av dem, men i själva verket når de sällan den genomsnittliga mellanpositionen.

Om du tar den genomsnittliga lönen på marknaden, juniortar emot någonstans mellan 120-150 tusen rubel före skatter per månad, mellan - upp till 250 tusen. Pensionärer om 400 tusen rubel. Top bar: Jag personligen höll erbjudandet i mina händer på huvudutvecklaren, det var mer än 600 tusen rubel.

"Datavetenskap är verkligen en slags" körsbär på en tårta ""

— Hur började du göra maskininlärning?

— Det fanns ingen datavetenskap på universitetet alls.Träning. Eftersom jag tog examen från universitetet 2012, ungefär samtidigt skedde ytterligare en ökning av saker som rör det. Har inte tid. Utexaminerad från två universitet, den sista var yrkeshögskolan i Karlsruhe, magisterexamen i mekatronik. Dessförinnan studerade han vid Moskva-institutet för kemiteknik, nu kallat Moskva Polytechnic. Jag var inte involverad i maskininlärning varken där eller där.

Rolig sak: Nu är de som kompletterar datavetenskap intervjuade, och det verkar som att deras nivå är svagare och lägre än hos de killar som har slutfört fysik, ingenjörsvetenskap, datavetenskap och då har maskininlärning "sårat" på det. Kanske är det ett litet skifte, för de killar som lärde sig själva var initialt starka, lärde sig något nytt och kom. Och datavetenskap är verkligen en slags "körsbär på en tårta", och om det inte finns någon "tårta" själv, men det finns en "körsbär", då är det inte så intressant.

- Hur lärde du dig detta?

— Det finns ett gammalt talesätt som säger att det finns två på Courseraseriös kurs, till och med en och en halv. Detta är Hintons kurs om maskininlärning och neurala nätverk (kursen är inte längre tillgänglig på Coursera, men kan ses på YouTube - Hi-Tech) och Daphne Kollers kurs om probabilistiska icke-grafiska modeller.

Koller kursen är video föreläsningar,som hon läser för att studera i Stanford. Därför vänder du inte språket för att inte kalla honom helt allvarligt. Hintons kurs är 16 veckor och Koller har tre kurser om fem till sex veckor. Och jag samlade styrkan i en knytnäve, gick igenom första kursen och insåg att den andra och tredje inte är redo att klara sig.

Men Coursera är inte det enda alternativet.Jag läser många böcker. Förresten, jag har nu avslutat Bradley Efrons bok om statistik (amerikansk statistiker, vinnare av US National Medal of Honor - den högsta statliga utmärkelsen för amerikanska forskare - "High-Tech"). Innan dess, en bok av Ian Godfellow (amerikansk maskininlärningsspecialist, arbetar på Google Brain - Hi-Tech) om djupinlärning. Det är en kontinuerlig inlärningsprocess. Coursera är bara en resurs, Kaggle (ett datavetenskapscommunity online som regelbundet är värd för tävlingar - "High-Tech") är en annan, men huvudsaken är att läsa, läsa, läsa och kolla. Om du läser det och inte förstår det är det dåligt. Om du förstår hur det fungerar kan du göra vad som helst.

Det är som multiplikationstabellen.Föreställ dig att en person inte förstår multiplikationstabellen, utan har lärt sig den utantill. De frågar honom: "Sex och sex?" - "36". - "Sju vid åtta?" - "56". - "Okej, sista frågan, 10 till 11?" — Mannen säger: "Jag vet inte, det fanns inte i multiplikationstabellen." Det är allt. Det är de människor jag ofta träffar. 10 av 11 är mycket lättare att beräkna, men detta är inte i tabellen, du måste förstå principen. Om du förstår principerna kommer allt att bli mycket lättare.

Allt annat beror på personen. Det verkar som om vi lär oss själva själva. Vi hjälper bara och stör inte andra människor. Allt detta handlar om självdisciplin.

— Berätta om din datavetenskapskurs på HSE.

- Det här är en fri kurs, den ligger inom standardenprogram, på det säger jag grundläggande enkla saker som för många människor - uppenbarelse. Till exempel, vilka mätvärden, varför finns de ens, hur skiljer de sig från varandra, i vilka fall är det nödvändigt att testa din idé om vad ett A / B-test är. Detta är vad jag själv har förtydat att det är viktigt för människor att veta och vad de verkligen behöver i sitt arbete.

- Hur ser du framtidens detaljhandel om fem till tio år?

— Om vi ​​pratar om dagligvaruhandeln, dåStormarknadsformatet kommer att dö ut. Detta kan ses nu i staterna, hur stora köpcentrum dör där ute, och i Ryssland, förresten, också. Hur var konsumtionsmönstret innan? Vi går till köpcentret, på bio, till food court och köper något annat. Nu kommer vi hem, ivi, Okko, Netflix, Yandex.Eda, Delivery Club, leverans från restaurang, onlineshopping. Vi måste gå mot personalisering.

- Vad betyder det för konsumenten?

- Man använder vad? Att han har råd och det är bekvämt för honom. Följaktligen är det nödvändigt att minska kostnaderna, behålla samma kvalitet eller öka den. Det här är personaliseringen som kommer upp i tankarna.

- En person köper vad han har råd med. Nu faller befolkningens reala inkomster, kostnaderna minskar.

— I en sådan situation formaterar butiksekonominmå bättre och växa. Det finns två sätt att lösa många problem för återförsäljare. Antingen automatiseras eller anställa tio personer till. På kort sikt är det andra sättet en vinnande strategi, eftersom integration är dyrt, tidskrävande och om något går fel kan du förlora din bonus. Föreställ dig nu att du är chef för en avdelning med en mycket stor bonus, och du kan förlora den. Det är oklart om du kommer att arbeta i företaget om två år, när resultatet av denna automatisering blir känt eller inte, och de kommer att berömma dig för dem. Och du kanske redan har en bonus. Därför anställer vi ytterligare tio personer. Men detta leder till en stor förlust i längden.