Hvordan computersyn vil vinde køer og tomme hylder i supermarkeder - Valery Babushkin, X5 Retail Group

"Det er let at vokse med 20%, hvis du har åbnet en og en halv gange flere butikker"

— I din tale du

sagde, at X5 Retail Groups omsætning nåede 1.286 billioner rubler i 2017, og at reducere omkostningerne selv med en lille brøkdel fører til enorme overskud. Hvordan udvider X5 sig?

— X5’s omsætning vil fortsætte med at vokse.Generelt er markedet på vej mod konsolidering i detailhandlen. I øjeblikket fylder vores tre førende detailhandlere omkring 20 % af markedet, og vi ser i udviklede kapitalistiske lande, at denne andel vil være omkring 70–75 %.

Hver dag åbner X5 i gennemsnit seks nyebutikker. Mens vi taler, åbner X5 en ny butik (griner). Faktisk går det godt, i modsætning til nogle andre markedsaktører. Hvis man ser på de åbne data, en af ​​dem, med en stigning i området på 12%, steg omsætningen med kun 84%. Det er nemt at beregne: de begynder at arbejde negativt. Der er sådan en indikator, LFL - Ligesom for en sammenligning af de samme butikker et år. På X5 på det, men lille, men et plus. Det vil sige, det er ikke svært at vokse med 20%, hvis du har åbnet en og en halv gange flere butikker, men det er en negativ vækst i virkeligheden. Hvis du vokser op på grund af at gamle butikker fungerer bedre og nye åbner, så er det ret positivt.

- Hvad tror du, hvilken andel af fordelene ved dit hold i dette?

- Det er ikke særlig stort endnu, for holdetdannet for ikke så længe siden. Lad os være ærlige, det er usandsynligt, at X5s vækst i 2017 skyldes vores anvendelse af dataanalyse ved hjælp af et team, der blev oprettet i 2018.

Lederen af ​​vores direktorat er Anton Mironenkov, en mand, der deltog i oprettelsen af ​​X5-virksomheden. Han var involveret i fusionen af ​​Perekrestok og Pyaterochka, hvorefter X5 dukkede op. 

Vi overvejer retningen af ​​big datastrategisk. Fremtiden for detailhandel afhænger af, hvor hurtigt detailhandlere lærer at tjene penge og bruge de data, som vi genererer i store mængder hver dag, til at optimere processer og forbedre kundeoplevelsen. Derfor besluttede vi at adskille alt dette i en separat retning og give det større fokus, så det udvikler sig hurtigere.

Anton Mironenkov, chef for Big Data Directorate X5

Inden for dette direktorat har vi vores egne kapaciteter,klynge, udviklere, testere, analytikere, projekter, produkter - alt hvad du har brug for. Vi har allerede gjort nogle ting, og det er et stort fremskridt i mindre end et år. Vi forstår klart, at vi vil give virksomheden et ret stort overskud, men igen vil disse resultater først være synlige om et år.

Alle oplysninger i checken - hvis du har købt vodka, så er du over 18 år gammel.

- Hvis jeg kommer til "Crossroads" og foretager et køb, hvad af alt dette vil du tage til analyse?

- Check. Dine produkter karakteriserer dig ret godt. Hvis du køber bleer, har du sikkert et lille barn. Hvis vodka, så er du over 18 år gammel. En person kan købe chips, og det vil med en vis sandsynlighed være en teenager på 16 år. Og hvis du har købt en dagbog, så har du eller din familie et barn fra syv til 17 år. Dette er en masse oplysninger.

Forestil: du kommer til butikken, kigger på nogle produkter og forstår at butikken er dyr, billig eller medium pris kategori. I Pyaterochka er der 4-8 tusind unikke produkter. Det er usandsynligt, at du går med en notesbog og skriver ned priserne for hele sættet og derefter ser på de gennemsnitlige priser på varer i byen og trækker en konklusion. Bare se på de fem til ti produkter. Og så hvilke produkter du ser på, vi er også forlovet.

Produkter, som folk ser på, ændres også medmed tiden. Et simpelt eksempel: For 20 år siden var der ingen produkter relateret til mobilkommunikation. Nu kan du, ikke i alle butikker, men købe et SIM-kort. For 20 år siden i Rusland var der generelt gange lidt sværere end nu, og forbruget var helt anderledes.

- Hvordan er oprettelsen af ​​kundeprofiler at tilbyde dem rabatter?

- Der er to produkter: kundeprofil og loyalitet. En klientprofil er en sådan opgave, når du ikke har nogle markeringer og bruger forskellige tilgange. Vi bruger forskellige tilgange til clustering - ud fra standardstatistikker beregner vi nogle Z-hastigheder, robuste afvigelser fra medianen og slutter med Word2vec, overlejret på checks og "oversætter" en person til vektor typen i gennemsnit via TF-IDF over Word2vec.

Z-score, Z-score- et statistisk skøn, der udtrykkerAfstanden (målt som standardafvigelse) af et givet niveau fra middelværdien af ​​datasættet. Især Z-score er en output-indikator for en virksomheds kreditværdighed og graden af ​​dens risiko for konkurs.

Robuste afvigelser fra engelsk. robust, "robust" er stabiliteten af ​​estimater med hensyn til emissioner i dataene. Betragtet i forhold til medianen.

Word2vecer et værktøj, der giver dig mulighed for at repræsentere ord som vektorer.

TF-IDF- et udtryk i statistik, der angiver graden af ​​betydning af et ord i et korpus af tekster.

Hvis du har nogen model, der gøret personligt forslag, så lad os antage, at clustering er vellykket, hvis kvaliteten af ​​modellerne forbedres efter at have tilføjet attributter. Her kan du beregne den økonomiske effekt og en slags metrisk.

- I hvilken del af butikkerne anvendes dine produkter?

- I alt.Vi testede den personlige rabat på en halv million brugere for at forstå dens effekt i alle 14 tusind X5-butikker. Vi indsamler interaktiv rapportering fra alle disse butikker. Vi har et salgsfremmende produkt, der er tilgængeligt i alle butikker. Vi har en sortimentsmatrix, vi har en efterspørgselsprognose. De sørger for, at der for det første er kylling i butikken, og for det andet, at kyllingen ikke er rådden.

Lad os nu begynde at lave computersyn, detvil ikke være tilgængelig i alle butikker i første omgang. Lad os starte med de største - det giver mening kun at teste i dem. Opgaven er ret enkel, fordelene er klare. Der er et produkt, det er måske ikke på hylden, men det kan ligge på lageret, og i det øjeblik er produktet ikke købt. Det er meget dårligt. Butikken købte den, men kan ikke sælge den. I bedste fald vil brugeren ikke købe produktet, og i værste fald vil han vende om og gå, fordi han ikke behøver at komme til, hvor han vil købe to af de tre produkter, og gå til en anden butik for den tredje. Han kommer direkte til butikken, hvor han kan købe alt. Og dette løses ved hjælp af computervision. Et kamera er placeret, og det registrerer, at du har lidt produkt tilbage. En meddelelse kommer til den ansvarlige for dette, han går til lageret for at købe dette produkt.

Den anden opgave er turnen. Vi ved, at vi har kø i butikken. Enten står du i køen, utilfreds og spilder tid, som ingen kan lide, eller gå i butikken, kig på køen, vend om og forlad. Hvis årsagen til køen er, at staten er underbemandet, kan der ikke gøres noget ved det. Og hvis problemet er, at den betingede salgskvinde sidder i baglokalet, hviler og drikker te, og direktøren kalder hende. Butikken er allerede i køen, og indtil den når, sidder ved computeren, tænder den, begynder at trække kasseren, tiden går forbi. Ser stadig på hende, hun er nervøs, også folk. Denne kasserer skal gå ud, før køen er dannet, således at der ved udgangstidspunktet allerede er gået til kasseren. Det er ret nemt at løse ved hjælp af computersyn.

Vi tester den ved omkring 150butikker, og højst sandsynligt i Moskva. For det første er vi selv i Moskva, og for det andet er der mere trafik her. Så bliver det klart, hvordan man forbedrer brugeroplevelsen, og hvad der er fordelen ved X5.

"Jeg kan virkelig ikke lide ordet datavidenskabsmand."

- Udvider du din ledelse?

- Selvfølgelig ser ledere, at vi giver resultater. Ingen giver dig mulighed for at udvide holdet to gange, hvis du ikke arbejder godt. I sig selv taler denne kendsgerning om vores effektivitet.

- Du sagde, at du har 32 medarbejdere, hvor mange flere vil du rekruttere?

- Stadig et sted 20-30. Vi vil nu bruge computersyn og taleteknologi som led i min ledelse. Der vil være to nye afdelinger, det vil sige det er plus ti personer, efter min mening er der enighed om yderligere 10-15 for næste år. Der er såkaldte projektpriser. Vi forventer at være 30-36 plus, et sted over 60 personer. Disse er specifikt de mennesker, der er involveret i dataanalyse og maskinindlæring.

- Hvem inviterer du til at arbejde?

- Jeg kan virkelig ikke lide ordet "data scientist"fordi den ikke indeholder nogen information. Du kan komme til ti virksomheder, hvor de søger en data scientist, og det bliver ti helt forskellige stillinger. Jeg kan godt lide ordet "analytiker". Mine afdelingsnavne taler for sig selv: Der er en maskinlæringsafdeling, en dataanalyseafdeling, en R&D-gruppe, det vil sige forskning, en computervisionsafdeling, en taleteknologiafdeling og en ikke-produktanalysegruppe til at løse disse problemer der kommer uden for enhver eksisterende produktretning.

Jeg leder efter folk der kan programmere iPython, kender sandsynlighedsteori og matematisk statistik, hvis jeg har brug for modellering, så kræves maskine læring færdigheder. Men det vigtigste er en persons evne til at tænke og analysere. Jeg kommer i stigende grad til tanken om, at analytisk tænkning og kritisk er noget, der er meget vanskeligt at undervise. Hvis der i 20-25 år allerede er noget verdensbillede, er det usandsynligt, at det vil ændre sig.

- Har du forstået dette i X5?

- Ikke at X5 førte mig til dette. Jeg ser også på folk, kommunikerer, se hvordan de arbejder. Som du ved, er det bedste interview en prøveperiode. Og på et tidspunkt ser du, at dette simpelthen ikke er for denne person. Det ser ud til, at han er uddannet fra mekhmat, det virker som om han ikke er en narre, men ikke ham. Der er ingen rigtig indstilling, kan ikke se ting. Det var i Daniel Kanemans bog "Tænk, Fast og Langsom", hvor han beskrev hvad der svarer til kritisk tænkning. Dette omfatter et pessimistisk syn på verden, og det er mere af en medfødt kvalitet end den, der erhverves, desværre eller heldigvis.

- Hvis en analytiker ankommer, og efter en prøveperiode forstår du, at han er egnet, hvad kan en person forvente?

- Standard i IT er der gradueringer - junior, mellem,senior og praktikant. Det findes sjældent ovenfor - det er personalet eller lederen. Jeg tror, ​​at der er en inflation af ledende stillinger: Vi har mange af dem, men faktisk når de sjældent den gennemsnitlige mellemstilling.

Hvis du tager den gennemsnitlige løn på markedet, juniormodtager et sted mellem 120-150 tusind rubler før skat per måned, mellem - op til 250 tusinde. Seniorer omkring 400 tusind rubler. Top bar: Jeg holdt personligt tilbudet i mine hænder på hovedudvikleren, det var mere end 600 tusind rubler.

"Datavidenskab er virkelig en slags" kirsebær på en kage ""

– Hvordan startede du med maskinlæring?

— Der var slet ingen datalogi på universitetet.uddannelse. Fordi jeg dimitterede fra universitetet i 2012, var der omkring samme tid endnu en stigning i ting relateret til det. Havde ikke tid. Uddannet fra to universiteter, det sidste var University of Applied Sciences i Karlsruhe, mastergrad i mekatronik. Før det studerede han ved Moskva Institut for Kemiteknik, nu kaldet Moskva Polytekniske Læreanstalt. Jeg var ikke involveret i maskinlæring hverken der eller der.

Sjovt: Nu er de, der gennemfører datalogi, interviewet, og det ser ud til, at deres niveau er svagere og lavere end for de fyre, der har afsluttet fysik, ingeniørvidenskab, datalogi, og så har maskinindlæring "såret" på det. Måske er dette et lille skifte, fordi de fyre, der lærte det selv, var oprindeligt stærke, lærte noget nyt og kom. Og datalogi er virkelig en slags "kirsebær på en kage", og hvis der ikke er en "kage" selv, men der er en "kirsebær", så er det ikke så interessant.

- Hvordan lærte du det her?

- Der er et gammelt ordsprog, der siger, at der er to på Courseraseriøst kursus, endda halvandet. Dette er Hintons kursus om maskinlæring og neurale netværk (kurset er ikke længere tilgængeligt på Coursera, men kan ses på YouTube - Hi-Tech) og Daphne Kollers kursus om probabilistiske ikke-grafiske modeller.

Koller-banen er videobånd forelæsninger,som hun læser for at studere elever på Stanford. Derfor kan man ikke kalde sproget for at kalde ham ikke helt seriøst. Hintons kursus varer 16 uger, og Koller har tre kurser på fem til seks uger. Og jeg samlede styrken i en knytnæve, gik igennem det første kursus og indså, at den anden og tredje er ikke klar til at passere.

Men Coursera er ikke den eneste mulighed.Jeg læser mange bøger. I øvrigt er jeg nu færdig med Bradley Efrons bog om statistik (amerikansk statistiker, vinder af US National Medal of Honor - den højeste statspris for amerikanske videnskabsmænd - "High-Tech"). Før det, en bog af Ian Godfellow (amerikansk maskinlæringsspecialist, arbejder hos Google Brain - Hi-Tech) om dyb læring. Det er en kontinuerlig læringsproces. Coursera er kun én ressource, Kaggle (et online datalogi-fællesskab, der regelmæssigt afholder konkurrencer - "High-Tech") er en anden, men det vigtigste er at læse, læse, læse og tjekke. Hvis du læser det og ikke forstår det, er det slemt. Hvis du forstår, hvordan det fungerer, kan du gøre alt.

Det er ligesom multiplikationstabellen.Forestil dig, at en person ikke forstår multiplikationstabellen, men har lært den udenad. De spørger ham: "Seks og seks?" - "36". - "Syv gange otte?" - "56". - "Okay, sidste spørgsmål, 10 til 11?" - Manden siger: "Jeg ved det ikke, det var ikke i multiplikationstabellen." Det er det. Det er de mennesker, jeg ofte møder. 10 gange 11 er meget nemmere at beregne, men dette er ikke i tabellen, du skal forstå princippet. Hvis du forstår principperne, vil alt være meget lettere.

Alt andet afhænger af personen. Det lader til, at vi lærer noget selv. Vi hjælper bare og forstyrrer ikke andre mennesker. Alt dette handler om selvdisciplin.

— Fortæl os om dit datavidenskabskursus på HSE.

- Dette er et gratis kursus, det er inden for standardenprogrammer, jeg fortæller grundlæggende enkle ting, som for mange mennesker - åbenbaring. For eksempel, hvad er metrics, hvorfor eksisterer de overhovedet, hvordan adskiller de sig fra hinanden, i hvilke tilfælde er det nødvendigt, hvordan man tester din ide om, hvad en A / B-test er. Dette er hvad jeg selv har udtalt, at det er vigtigt for folk at kende og hvad de virkelig har brug for i deres arbejde.

- Hvordan ser du fremtiden for detailhandel om fem til ti år?

— Hvis vi taler om detailhandel med fødevarer, såHypermarkedsformatet vil dø ud. Dette kan ses nu i staterne, hvor store indkøbscentre dør derude, og i Rusland forresten også. Hvad var forbrugsmønsteret før? Vi går i indkøbscenteret, i biografen, på foodcourten og køber noget andet. Nu kommer vi hjem, ivi, Okko, Netflix, Yandex.Eda, Delivery Club, levering fra en restaurant, online shopping. Vi skal bevæge os mod personalisering.

- Hvad vil det betyde for forbrugeren?

- Man bruger hvad? At han har råd til, og det er praktisk for ham. Derfor er det nødvendigt at reducere omkostningerne, holde den samme kvalitet eller øge den. Det er her personalisering kommer til at tænke på.

- En person køber hvad han har råd til. Nu falder befolkningens reale indkomster, omkostningerne falder.

— I en sådan situation formaterer butiksøkonomienføle sig bedre og vokse. Der er to måder at løse mange problemer på for detailhandlere. Enten automatisering eller ansæt ti personer mere. På kort sigt er den anden måde en vindende strategi, fordi integration er dyrt, tidskrævende, og hvis noget går galt, kan du miste din bonus. Forestil dig nu, at du er direktør for en afdeling med en meget stor bonus, og du kan miste den. Det er uklart, om du vil arbejde i virksomheden om to år, når resultaterne af denne automatisering bliver kendt, eller ej, og de vil rose dig for dem. Og du har måske allerede en bonus. Derfor ansætter vi ti personer mere. Men det fører til et stort tab i det lange løb.