"Det er lett å vokse med 20% hvis du har åpnet en og en halv ganger flere butikker"
— I talen din du
— X5s omsetning vil fortsette å vokse.Generelt går markedet mot konsolidering i detaljhandelen. For tiden okkuperer våre tre ledende forhandlere omtrent 20 % av markedet, og vi ser i utviklede kapitalistiske land at denne andelen vil være rundt 70–75 %.
Hver dag i gjennomsnitt åpner X5 seks nyebutikker. Mens vi snakker, åpner X5 en ny butikk (ler). Faktisk går det bra, i motsetning til noen andre markedsaktører. Hvis du ser på de åpne dataene, en av dem, med en økning i området på 12%, økte omsetningen med bare 84%. Det er lett å beregne: de begynner å fungere negativt. Det er en slik indikator, LFL - Som for en sammenligning av de samme lagrene hvert år. På X5 på den, men liten, men et pluss. Det vil si at det ikke er vanskelig å vokse med 20% hvis du har åpnet en og en halv ganger flere butikker, men dette er en negativ vekst faktisk. Hvis du vokser opp på grunn av at gamle butikker fungerer bedre og nye er åpne, så er dette ganske positivt.
- Hva tror du, hvilken andel av verdien av teamet ditt i dette?
— Det er ikke veldig stort ennå, fordi lagetdannet for ikke så lenge siden. La oss være ærlige, X5s vekst i 2017 skyldes neppe vår bruk av dataanalyse, med hjelp av et team opprettet i 2018.
Leder for vårt direktorat er Anton Mironenkov, en mann som deltok i opprettelsen av X5-selskapet. Han var involvert i sammenslåingen av Perekrestok og Pyaterochka, hvoretter X5 dukket opp.
Vi vurderer retningen til big datastrategisk. Fremtiden for detaljhandel avhenger av hvor raskt forhandlere lærer å tjene penger og bruke dataene vi genererer i store mengder hver dag for å optimalisere prosesser og forbedre kundeopplevelsen. Derfor bestemte vi oss for å dele alt dette i en egen retning og gi det større fokus slik at det utvikler seg raskere.

Anton Mironenkov, leder av Big Data Directorate X5
Innenfor dette direktoratet har vi vår egen kapasitet,klynge, utviklere, testere, analytikere, prosjekter, produkter - alt du trenger. Vi har allerede gjort noen ting, og dette er mye fremgang i mindre enn ett år. Vi forstår tydelig at vi vil gi selskapet et ganske stort overskudd, men igjen vil disse resultatene være synlige først om et år.
All informasjon i sjekken - hvis du kjøpte vodka, da er du over 18 år gammel.
- Hvis jeg kommer til "Crossroads" og foretar et kjøp, hva av alt dette vil du ta for analyse?
- Sjekk. Dine produkter karakteriserer deg ganske bra. Hvis du kjøper bleier, har du sannsynligvis et lite barn. Hvis vodka er du over 18 år gammel. En person kan kjøpe sjetonger, og det vil med en viss sannsynlighet være en tenåring på 16 år. Og hvis du kjøpte en dagbok, så har du eller din familie et barn fra sju til 17 år. Dette er mye informasjon.
Tenk deg: du kommer til butikken, ser på noen produkter og forstår at butikken er dyr, billig eller middels priskategori. I Pyaterochka er det 4-8000 unike produkter. Det er lite sannsynlig at du går med en notatbok og skriver ned prisene for hele settet av varer, og deretter ser på de gjennomsnittlige prisene på varer i byen og trekker en konklusjon. Bare se på de fem til ti produktene. Og så hvilke produkter du ser på, vi er også engasjert.
Produkter som folk ser på, endres også medetter tid. Et enkelt eksempel: For 20 år siden var det ingen produkter knyttet til mobilkommunikasjon. Nå kan du, ikke i alle butikkene, men kjøpe et SIM-kort. For 20 år siden i Russland var det generelt litt vanskeligere enn de er nå, og forbruket var helt annerledes.
- Hvordan er opprettelsen av kundeprofiler å tilby dem rabatter?
- Det er to produkter: kundeprofil og lojalitet. En klientprofil er en slik oppgave når du ikke har noen oppslag og bruker forskjellige tilnærminger. Vi bruker forskjellige tilnærminger til clustering - ut fra standardstatistikk, beregne noen Z-hastigheter, robuste avvik fra medianen, og slutte med Word2vec, lagt på sjekker og "oversette" en person inn i vektortypen i gjennomsnitt gjennom TF-IDF over Word2vec.
Z-score, Z-score- et statistisk estimat som uttrykkerAvstanden (målt som standardavvik) til et gitt nivå fra gjennomsnittet av datasettet. Spesielt er Z-score en produksjonsindikator på et selskaps kredittverdighet og graden av risikoen for konkurs.
Robuste avvik fra engelsk. robust, "robust" er stabiliteten av estimater med hensyn til utslipp i dataene. Betraktet i forhold til medianen.
Word2vecer et verktøy som lar deg representere ord som vektorer.
TF-IDF- et begrep i statistikk som angir graden av betydning av et ord i et korpus av tekster.
Hvis du har noen modell som gjøret personlig forslag, så la oss anta at clustering er vellykket hvis kvaliteten etter modellene forbedres etter at du har lagt til attributter. Her kan du beregne den økonomiske effekten, og en slags metrisk.
- I hvilken del av butikkene brukes produktene dine?
- I alt.Vi testet den personlige rabatten på en halv million brukere for å forstå effekten i alle 14 tusen X5-butikker. Vi samler inn interaktiv rapportering fra alle disse butikkene. Vi har et kampanjeprodukt som er tilgjengelig i alle butikker. Vi har en sortimentsmatrise, vi har en etterspørselsprognose. De sørger for at det for det første er kylling i butikken og for det andre at kyllingen ikke er råtten.
La oss nå begynne å gjøre datasyn, detvil ikke være tilgjengelig i alle butikker med det første. La oss starte med de største - det er fornuftig å teste bare i dem. Oppgaven er ganske enkel, fordelene er klare. Det er et produkt, det er kanskje ikke på hyllen, men det kan ligge på lageret, og i det øyeblikket er ikke produktet kjøpt. Dette er veldig dårlig. Butikken kjøpte den, men kan ikke selge den. I beste fall vil ikke brukeren kjøpe produktet, og i verste fall vil han snu og gå, fordi han ikke trenger å komme dit han skal kjøpe to av de tre produktene, og gå til en annen butikk for den tredje. Han kommer rett til butikken hvor han kan kjøpe alt. Og dette løses ved hjelp av datasyn. Et kamera er plassert og det registrerer at du har lite produkt igjen. En melding kommer til den ansvarlige for dette, han går til lageret for å kjøpe dette produktet.
Den andre oppgaven er svingen. Vi vet at vi har en kø i butikken. Enten står du i kø, misfornøyd og sløser med tid som ingen liker, eller gå til butikken, se på køen, snu og gå. Hvis årsaken til køen er at staten er underbemannet, kan ingenting gjøres om det. Og hvis problemet er at den betingede selgeren sitter i bakrommet, hviler og drikker te, og regissøren kaller henne. Butikken er allerede i kø, og til den når, sitter ved datamaskinen, slår den på, begynner å trekke kasseren, tiden går forbi. Hun ser fortsatt på henne, hun er nervøs, også folk. Denne kassen må gå ut før køen dannes, slik at ved utgangstidspunktet har folk allerede gått til kassereren. Det er ganske enkelt å løse ved hjelp av datasyn.
Vi skal teste den rundt 150butikker, og mest sannsynlig i Moskva. For det første er vi selv i Moskva, og for det andre er det mer trafikk her. Da vil det bli klart hvordan man kan forbedre brukeropplevelsen og hva som er fordelen med X5.
"Jeg liker ikke ordet datavitenskapsmann."
- Utvider du ledelsen?
- Selvfølgelig ser ledere at vi gir resultater. Ingen lar deg utvide laget to ganger hvis du ikke jobber bra. I seg selv snakker dette faktum om vår effektivitet.
- Du sa at du har 32 personer som jobber, hvor mange flere vil du rekruttere?
- Fortsatt et sted 20-30. Vi vil nå bruke visjon og taleteknologi som en del av ledelsen min. Det vil bli to nye avdelinger, det vil si dette er pluss ti personer, etter min mening er en annen 10-15 enige om neste år. Det er såkalte prosjektpriser. Vi forventer at det skal være 30-36 pluss, et sted over 60 personer. Disse er spesielt menneskene som er engasjert i dataanalyse og maskinlæring.
- Hvem inviterer deg til å jobbe?
— Jeg liker virkelig ikke ordet «dataforsker»fordi den ikke inneholder noen informasjon. Du kan komme til ti bedrifter hvor de søker etter en dataforsker, og dette vil være ti helt forskjellige stillinger. Jeg liker ordet "analytiker". Avdelingsnavnene mine taler for seg selv: det er en maskinlæringsavdeling, en dataanalyseavdeling, en FoU-gruppe, det vil si forskning, en datasynsavdeling, en taleteknologiavdeling og en ikke-produktanalysegruppe for å løse disse problemene som kommer utenfor enhver eksisterende produktretning.
Jeg leter etter folk som kan programmere iPython, vet sannsynlighetsteori og matematisk statistikk, hvis jeg trenger modellering, er det nødvendig med maskinopplæringsevner. Men det viktigste er en persons evne til å tenke og analysere. Jeg kommer i økende grad til ideen om at analytisk tenkning og kritisk er noe som er veldig vanskelig å undervise. Hvis 20-25 år er det allerede noe verdenssyn, er det lite sannsynlig å forandre seg.
- Har du forstått dette i X5?
- Ikke at X5 førte meg til dette. Jeg ser også på folk, kommuniserer, se hvordan de jobber. Som du vet er det beste intervjuet en prøveperiode. Og på et tidspunkt ser du at dette ikke er rett og slett ikke for denne personen. Det ser ut til at han tok ut eksamen fra mekhmat, det virker som han ikke er en idiot, men ikke han. Det er ingen riktig holdning, ser ikke ting. Det var i Daniel Kanemans bok "Thinking, Fast and Slow", der han beskrev hva som tilsvarer kritisk tenkning. Dette inkluderer en pessimistisk utsikt over verden, og det er mer avfødt kvalitet enn det som er innhentet, dessverre eller heldigvis.
- Hvis en analytiker ankommer, og etter en prøveperiode forstår du at han er egnet, hva kan en person forvente?
- Standard i IT er det graderinger - junior, mellom,senior og trainee. Det finnes sjelden ovenfor - dette er personalet eller lederen. Jeg tror at det er en inflasjon av seniorstillingen: Vi har mange av dem, men faktisk når de sjelden den gjennomsnittlige mellomposisjonen.
Hvis du tar gjennomsnittlig lønn på markedet, juniormottar et sted mellom 120-150 tusen rubler før skatt per måned, midt - opp til 250 tusen. Seniorer om 400 tusen rubler. Top bar: Jeg personlig holdt tilbudet i hendene på ledende utvikler, det var mer enn 600 tusen rubler.
"Datavitenskap er virkelig en slags" kirsebær på en kake ""
— Hvordan begynte du med maskinlæring?
— Det fantes ikke informatikk på universitetet i det hele tatt.opplæring. Fordi jeg ble uteksaminert fra universitetet i 2012, var det omtrent samtidig en økning i ting relatert til det. Hadde ikke tid. Uteksaminert fra to universiteter, den siste var University of Applied Sciences i Karlsruhe, mastergrad i mekatronikk. Før det studerte han ved Moscow Institute of Chemical Engineering, nå kalt Moskva Polytechnic. Jeg var ikke involvert i maskinlæring verken der eller der.
Morsom ting: Nå er de som fullfører datavitenskap intervjuet, og det ser ut til at nivået deres er svakere og lavere enn det for de gutta som har fullført fysikk, ingeniørfag, datavitenskap, og så har maskinlæring "såret" på den. Kanskje dette er et lite skifte, fordi gutta som lærte det selv var i utgangspunktet sterke, lærte noe nytt og kom. Og datavitenskap er virkelig en slags "kirsebær på en kake", og hvis det ikke er "kake" selv, men det er en "kirsebær", så er dette ikke så interessant.
- Hvordan lærte du dette?
— Det er et gammelt ordtak som sier at på Coursera er det toseriøst kurs, til og med ett og et halvt. Dette er Hintons kurs om maskinlæring og nevrale nettverk (kurset er ikke lenger tilgjengelig på Coursera, men kan sees på YouTube - Hi-Tech) og Daphne Kollers kurs om probabilistiske ikke-grafiske modeller.
Koller kurset er videobånd forelesninger,som hun leser for å studere studenter på Stanford. Derfor, for å kalle ham ikke helt alvorlig, snur ikke språket. Hintons kurs varer 16 uker, og Koller har tre kurs på fem til seks uker. Og jeg samlet styrken i en knyttneve, gikk gjennom første kurset og skjønte at den andre og tredje er ikke klar til å passere.
Men Coursera er ikke det eneste alternativet.Jeg leser mange bøker. Forresten, jeg er nå ferdig med Bradley Efrons bok om statistikk (amerikansk statistiker, vinner av US National Medal of Honor - den høyeste statlige prisen for amerikanske forskere - "High-Tech"). Før det, en bok av Ian Godfellow (amerikansk maskinlæringsspesialist, jobber hos Google Brain - Hi-Tech) om dyp læring. Det er en kontinuerlig læringsprosess. Coursera er bare én ressurs, Kaggle (et nettbasert datavitenskapelig fellesskap som regelmessig arrangerer konkurranser – "High-Tech") er en annen, men det viktigste er å lese, lese, lese og sjekke. Hvis du leser den og ikke forstår den, er det ille. Hvis du forstår hvordan det fungerer, kan du gjøre hva som helst.
Det er som multiplikasjonstabellen.Tenk deg at en person ikke forstår multiplikasjonstabellen, men har lært den utenat. De spør ham: "Seks og seks?" - "36". - "Syv av åtte?" - "56". - "Ok, siste spørsmål, 10 til 11?" — Mannen sier: «Jeg vet ikke, det var ikke i multiplikasjonstabellen.» Det er det. Dette er menneskene jeg ofte møter. 10 til 11 er mye lettere å beregne, men dette er ikke i tabellen, du må forstå prinsippet. Hvis du forstår prinsippene, vil alt være mye lettere.
Alt annet avhenger av personen. Det virker som om vi lærer noe selv. Vi hjelper bare og ikke forstyrrer andre mennesker. Alt dette handler om selvdisiplin.
— Fortell oss om datavitenskap-kurset ditt på HMS.
- Dette er et gratis kurs, det er innenfor standardenprogrammer, på det forteller jeg grunnleggende enkle ting som for mange mennesker - åpenbaring. For eksempel, hva er beregningene, hvorfor eksisterer de i det hele tatt, hvordan adskiller de seg fra hverandre, i hvilke tilfeller er det nødvendig å teste ideen om hva en A / B-test er. Dette er hva jeg har gitt ut for meg selv at det er viktig for folk å vite og hva de virkelig trenger i sitt arbeid.
- Hvordan ser du fremtiden for detaljhandel om fem til ti år?
— Hvis vi snakker om dagligvarehandel, daHypermarkedsformatet vil dø ut. Dette kan sees nå i USA, hvor store kjøpesentre dør der ute, og i Russland, forresten, også. Hva var forbruksmønsteret før? Vi går på kjøpesenteret, på kinoen, på foodcourten og kjøper noe annet. Nå kommer vi hjem, ivi, Okko, Netflix, Yandex.Eda, Delivery Club, levering fra restaurant, netthandel. Vi må bevege oss mot personalisering.
- Hva vil det bety for forbrukeren?
- Man bruker hva? At han har råd og det er praktisk for ham. Derfor er det nødvendig å redusere kostnadene, holde samme kvalitet eller øke den. Dette er hvor personliggjørelse kommer i tankene.
- En person kjøper det han har råd til. Nå faller befolkningens reelle inntekter, kostnadene faller.
— I en slik situasjon formaterer butikkøkonomiføle seg bedre og vokse. Det er to måter å løse mange problemer på for forhandlere. Enten automatisering eller ansett ti personer til. På kort sikt er den andre måten en vinnende strategi, fordi integrasjon er dyrt, tidkrevende, og hvis noe går galt, kan du miste bonusen din. Tenk deg nå at du er direktør for en avdeling med en veldig stor bonus, og du kan miste den. Det er uklart om du vil jobbe i bedriften om to år, når resultatene av denne automatiseringen blir kjent, eller ikke, og de vil rose deg for dem. Og du har kanskje allerede en bonus. Derfor ansetter vi ti personer til. Men dette fører til et stort tap i det lange løp.