"Het is gemakkelijk om met 20% te groeien als je anderhalve keer winkels hebt geopend"
– In je toespraak jij
— De omzet van X5 zal blijven groeien.Over het algemeen evolueert de markt in de richting van consolidatie in de detailhandel. Momenteel bezetten onze drie grootste detailhandelaren ongeveer 20% van de markt, en we zien in ontwikkelde kapitalistische landen dat dit aandeel ongeveer 70-75% zal bedragen.
Elke dag opent gemiddeld X5 zes nieuwewinkels. Terwijl we praten, opent X5 een nieuwe winkel (lacht). Inderdaad gaat het goed, in tegenstelling tot sommige andere marktspelers. Als je kijkt naar de open data, een daarvan, met een toename van 12%, steeg de omzet met slechts 84%. Het is eenvoudig te berekenen: ze beginnen negatief te werken. Er is zo'n indicator, LFL - Like like like, een vergelijking van dezelfde winkels per jaar. Bij X5 erop, hoewel klein, maar een plus. Dat wil zeggen, het is niet moeilijk om met 20% te groeien als je anderhalf keer zoveel winkels hebt geopend, maar dit is in feite een negatieve groei. Als je opgroeit vanwege het feit dat oude winkels beter werken en nieuwe open gaan, dan is dit vrij positief.
- Wat denk je, wat is het aandeel van je team hierin?
— Het is nog niet zo groot, omdat het teamnog niet zo lang geleden gevormd. Laten we eerlijk zijn: het is onwaarschijnlijk dat de groei van X5 in 2017 te danken is aan onze toepassing van data-analyse, met de hulp van een team dat in 2018 is opgericht.
Het hoofd van ons directoraat is Anton Mironenkov, een man die heeft deelgenomen aan de oprichting van het bedrijf X5. Hij was betrokken bij de fusie van Perekrestok en Pyaterochka, waarna X5 verscheen.
We kijken naar de richting van big datastrategisch. De toekomst van de detailhandel hangt af van hoe snel retailers leren geld te verdienen en de gegevens die we dagelijks in grote hoeveelheden genereren, gebruiken om processen te optimaliseren en de klantervaring te verbeteren. Daarom hebben we besloten dit allemaal in een aparte richting te verdelen en er meer focus op te leggen, zodat het zich sneller ontwikkelt.

Anton Mironenkov, hoofd van Big Data Directorate X5
Binnen dit directoraat beschikken wij over onze eigen capaciteiten,cluster, ontwikkelaars, testers, analisten, projecten, producten - alles wat je nodig hebt. We hebben al een aantal dingen gedaan, en dit is een hele vooruitgang in minder dan een jaar tijd. We begrijpen duidelijk dat we het bedrijf een vrij grote winst zullen opleveren, maar nogmaals, deze resultaten zullen pas over een jaar zichtbaar zijn.
Alle informatie in de cheque - als je wodka hebt gekocht, ben je ouder dan 18 jaar.
- Als ik naar de "Crossroads" kom en een aankoop doe, wat moet u dan allemaal voor analyse doen?
- Controleer. Uw producten kenmerken u vrij goed. Als je luiers koopt, heb je waarschijnlijk een klein kind. Als wodka, dan ben je ouder dan 18 jaar. Een persoon kan chips kopen, en het zal met een zekere waarschijnlijkheid een tiener van 16 jaar zijn. En als u een dagboek hebt gekocht, heeft u of uw gezin een kind van zeven tot 17 jaar oud. Dit is veel informatie.
Stel je voor: je komt naar de winkel, kijkt naar sommige producten en begrijpt dat de winkel een dure, goedkope of middelmatige prijscategorie is. In Pyaterochka zijn er van 4 tot 8 duizend unieke producten. Het is onwaarschijnlijk dat je met een notebook gaat en de prijzen voor de hele set goederen noteert, en dan naar de gemiddelde prijzen van goederen in de stad kijkt en een conclusie trekt. Kijk maar naar de vijf tot tien producten. En dus naar welke producten je kijkt, we zijn ook verloofd.
Producten waar mensen naar kijken veranderen ook meetegen de tijd. Een eenvoudig voorbeeld: 20 jaar geleden waren er geen producten gerelateerd aan mobiele communicatie. Nu kun je, niet in alle winkels, maar een simkaart kopen. 20 jaar geleden waren er in Rusland over het algemeen een beetje moeilijker dan nu, en de consumptie was totaal anders.
- Hoe is het creëren van klantprofielen om kortingen aan te bieden?
- Er zijn twee producten: klantprofiel en loyaliteit. Een klantprofiel is zo'n taak als u niet over enige markup beschikt en verschillende benaderingen gebruikt. We gebruiken verschillende benaderingen voor clustering - uitgaande van standaardstatistieken, berekening van enkele Z-snelheden, robuuste afwijkingen van de mediaan en eindigend met Word2vec, gesuperponeerd op controles en een persoon "translerend" in een type vector gemiddeld via TF-IDF via Word2vec.
Z-score, Z-score- een statistische schatting die uitdruktDe afstand (gemeten als standaardafwijking) van een bepaald niveau tot het gemiddelde van de dataset. Met name de Z-score is een outputindicator voor de kredietwaardigheid van een bedrijf en de mate van faillissementsrisico.
Robuuste afwijkingen van het Engels. robuust, "robuust" is de stabiliteit van schattingen met betrekking tot emissies in de gegevens. Beschouwd ten opzichte van de mediaan.
Word2vecis een hulpmiddel waarmee u woorden als vectoren kunt weergeven.
TF-IDF- een term in de statistiek die de mate van belangrijkheid van een woord in een corpus van teksten aangeeft.
Als je een model hebt dat maakteen persoonlijk voorstel, laten we dan aannemen dat clustering succesvol is als, na het toevoegen van attributen, de kwaliteit van de modellen verbetert. Hier kun je het economische effect en een soort metriek berekenen.
- In welk deel van de winkels worden uw producten gebruikt?
- In alles.We hebben de gepersonaliseerde korting getest op een half miljoen gebruikers om het effect ervan in alle 14.000 X5-winkels te begrijpen. Van al deze winkels verzamelen we interactieve rapportages. Wij hebben een actieproduct dat in alle winkels verkrijgbaar is. We hebben een assortimentsmatrix, we hebben een vraagvoorspelling. Zij zorgen ervoor dat er ten eerste kip in de winkel ligt en ten tweede dat de kip niet rot is.
Laten we nu beginnen met computervisie, hetzal in eerste instantie niet in alle winkels verkrijgbaar zijn. Laten we beginnen met de grootste - het is logisch om alleen daarin te testen. De taak is vrij eenvoudig, de voordelen zijn duidelijk. Er is een product, het ligt misschien niet in het schap, maar het kan wel in het magazijn liggen, en op dat moment is het product niet gekocht. Dit is erg slecht. De winkel heeft het gekocht, maar kan het niet verkopen. In het beste geval zal de gebruiker het product niet kopen, en in het slechtste geval zal hij zich omdraaien en weggaan, omdat hij niet naar de plaats hoeft te komen waar hij twee van de drie producten zal kopen, en naar een andere winkel moet gaan. de derde. Hij komt rechtstreeks naar de winkel waar hij alles kan kopen. En dit wordt opgelost met behulp van computer vision. Er wordt een camera geplaatst en deze detecteert dat je nog weinig product over hebt. Er komt een melding bij de hiervoor verantwoordelijke persoon, hij gaat naar het magazijn om dit product te kopen.
De tweede taak is de turn. We weten dat we een wachtrij hebben in de winkel. Of je staat in de rij, bent ontevreden en verspilt tijd die niemand leuk vindt, of gaat naar de winkel, kijkt naar de rij, draait zich om en vertrekt. Als de reden voor de wachtrij is dat de staat onderbemand is, kan er niets aan worden gedaan. En als het probleem is dat de voorwaardelijke verkoopster in de achterkamer zit, rust en drinkt thee, en de directeur belt haar. De winkel bevindt zich al in de rij en tot aan de rand van de winkel gaat hij achter de computer zitten, zet hem aan, begint de kassier te trekken en de tijd verstrijkt. Nog steeds naar haar kijkend, is ze nerveus, ook mensen. Deze kassier moet uitgaan voordat de rij wordt gevormd, zodat tegen de tijd van vertrek mensen al naar de kassier zijn gegaan. Het is vrij eenvoudig om op te lossen met behulp van computer vision.
We testen het op ongeveer 150winkels, en hoogstwaarschijnlijk in Moskou. Ten eerste zijn wij zelf in Moskou, en ten tweede is er hier meer verkeer. Dan wordt duidelijk hoe de gebruikerservaring verbeterd kan worden en wat het voordeel is van X5.
"Ik hou echt niet van het woord data scientist."
- Breidt u uw management uit?
- Natuurlijk zien managers dat we resultaten boeken. Niemand biedt je de mogelijkheid om het team twee keer uit te breiden als je niet goed werkt. Op zichzelf spreekt dit feit over onze effectiviteit.
- U zei dat u 32 mensen aan het werk hebt, hoeveel meer zult u aanwerven?
- Nog ergens tussen 20 en 30. We zullen nu computervisie en spraaktechnologie gebruiken als onderdeel van mijn beheer. Er zullen twee nieuwe afdelingen komen, dat wil zeggen, dit is plus tien mensen, naar mijn mening zijn er nog eens 10-15 overeengekomen voor volgend jaar. Er zijn zogenaamde projecttarieven. We verwachten dat het 30-36 plus is, ergens meer dan 60 mensen. Dit zijn met name de mensen die zich bezig houden met data-analyse en machine learning.
- Wie nodig je uit om te werken?
— Ik hou echt niet van het woord ‘datawetenschapper’omdat het geen enkele informatie bevat. Je kunt bij tien bedrijven terecht waar ze op zoek zijn naar een datawetenschapper, en dat zullen tien totaal verschillende functies zijn. Ik hou van het woord ‘analist’. De namen van mijn afdelingen spreken voor zich: er is een afdeling machine learning, een afdeling data-analyse, een R&D-groep, dat wil zeggen onderzoek, een afdeling computervisie, een afdeling spraaktechnologie en een niet-productanalysegroep voor het oplossen van deze problemen. die buiten elke bestaande productrichting vallen.
Ik ben op zoek naar mensen die kunnen programmerenPython, weet waarschijnlijkheidstheorie en wiskundige statistieken, als ik modellering nodig heb, dan zijn machinale leervaardigheden vereist. Maar het belangrijkste is het vermogen van een persoon om te denken en te analyseren. Ik kom steeds vaker tot het idee dat analytisch denken en kritisch iets is dat heel moeilijk te onderwijzen is. Als er tegen 20-25 jaar al een wereldbeeld bestaat, is het onwaarschijnlijk dat dit zal veranderen.
- Heb je dit in X5 begrepen?
- Niet dat de X5 me hiertoe heeft gebracht. Ik kijk ook naar mensen, communiceer, zie hoe ze werken. Zoals je weet, is het beste interview een proefperiode. En op een gegeven moment zie je dat dit gewoon niet voor deze persoon is. Dat wil zeggen, het lijkt erop dat hij afstudeerde van mekhmat, het lijkt erop dat hij geen dwaas is, maar hij niet. Er is geen juiste houding, zie geen dingen. Het was in Daniel Kaneman's boek "Thinking, Fast and Slow", waarin hij beschreef wat overeenkomt met kritisch denken. Dit omvat een pessimistische kijk op de wereld, en het is meer een aangeboren eigenschap dan die, helaas of gelukkig.
- Als een analist arriveert en u na een proefperiode begrijpt dat hij geschikt is, wat kan een persoon dan verwachten?
- Standaard zijn er in de IT gradaties: junior, midden,senior en stagiair. Het wordt zelden hierboven gevonden - dit is de staf of de leider. Ik denk dat er sprake is van een inflatie van de hogere posities: we hebben er veel, maar in feite bereiken ze zelden de gemiddelde middenpositie.
Als u het gemiddelde salaris op de markt neemt, juniorontvangt ergens tussen 120-150 duizend roebel voor belastingen per maand, midden - tot 250 duizend Senioren ongeveer 400 duizend roebel. Topstaaf: ik hield persoonlijk het aanbod in handen van de hoofdontwikkelaar, het was meer dan 600 duizend roebel.
"Data science is echt een soort" kers op de taart ""
— Hoe ben je begonnen met machinaal leren?
— Er was helemaal geen computerwetenschap op de universiteit.opleiding. Omdat ik in 2012 afstudeerde aan de universiteit, was er rond dezelfde tijd een nieuwe stijging van de zaken die daarmee verband hielden. Had geen tijd. Afgestudeerd aan twee universiteiten, de laatste was de University of Applied Sciences in Karlsruhe, master in mechatronica. Daarvoor studeerde hij aan het Moskouse Instituut voor Chemische Technologie, nu de Moskouse Polytechniek genoemd. Ik was daar noch daar betrokken bij machinaal leren.
Grappig ding: Nu worden diegenen die gegevenswetenschap voltooien geïnterviewd, en het lijkt erop dat hun niveau zwakker en lager is dan dat van die kerels die natuurkunde, techniek, computerwetenschap en vervolgens machinaal leren hebben afgerond. Misschien is dit een kleine verschuiving, omdat de jongens die het zelf leerden in eerste instantie sterk waren, iets nieuws leerden en kwamen. En data science is echt een soort "kers op de taart", en als er zelf geen "cake" is, maar er is een "kers", dan is dit niet zo interessant.
- Hoe heb je dit geleerd?
— Er is een oud gezegde dat er op Coursera twee zijnserieuze cursus, zelfs anderhalf. Dit is de cursus van Hinton over machine learning en neurale netwerken (de cursus is niet langer beschikbaar op Coursera, maar kan worden bekeken op YouTube - Hi-Tech) en de cursus van Daphne Koller over probabilistische niet-grafische modellen.
De Koller-cursus is op video opgenomen lezingen,die ze leest om studenten af te studeren aan Stanford. Daarom, om hem niet helemaal serieus te noemen, verandert de taal niet. De cursus van Hinton duurt 16 weken en Koller heeft drie cursussen van vijf tot zes weken. En ik verzamelde de kracht in een vuist, ging door de eerste gang en besefte dat de tweede en derde niet klaar zijn om te passeren.
Maar Coursera is niet de enige optie.Ik lees veel boeken. Trouwens, ik heb nu het boek van Bradley Efron over statistiek uit (Amerikaans statisticus, winnaar van de US National Medal of Honor - de hoogste staatsonderscheiding voor Amerikaanse wetenschappers - "High-Tech"). Daarvoor verscheen een boek van Ian Godfellow (Amerikaanse machine learning-specialist, werkt bij Google Brain - Hi-Tech) over deep learning. Het is een continu leerproces. Coursera is slechts één hulpbron, Kaggle (een online computerwetenschapsgemeenschap die regelmatig wedstrijden organiseert - "High-Tech") is een andere, maar het belangrijkste is lezen, lezen, lezen en controleren. Als je het leest en het niet begrijpt, is dat slecht. Als je begrijpt hoe het werkt, kun je alles doen.
Het is net als de tafel van vermenigvuldiging.Stel je voor dat iemand de tafel van vermenigvuldiging niet begrijpt, maar deze uit zijn hoofd heeft geleerd. Ze vragen hem: “Zes bij zes?” - “36”. - "Zeven bij acht?" - “56”. - “Oké, laatste vraag, 10 tot 11?” — De man zegt: “Ik weet het niet, het stond niet in de tafel van vermenigvuldiging.” Dat is het. Dit zijn de mensen die ik vaak ontmoet. 10 bij 11 is veel gemakkelijker te berekenen, maar dit staat niet in de tabel, je moet het principe begrijpen. Als je de principes begrijpt, zal alles veel gemakkelijker zijn.
Al het andere hangt van de persoon af. Het lijkt erop dat we zelf iets leren. We helpen alleen maar en bemoeien ons niet met andere mensen. Dit alles is een kwestie van zelfdiscipline.
— Vertel ons over uw data science-cursus bij HSE.
- Dit is een gratis cursus, deze valt binnen de normprogramma's, daarop vertel ik simpele basisdingen die voor veel mensen een openbaring zijn. Wat zijn bijvoorbeeld de statistieken, waarom bestaan ze überhaupt, hoe verschillen ze van elkaar, in welke gevallen is het nodig, hoe je je idee kunt testen wat een A / B-test is. Dit is wat ik voor mezelf naar voren bracht dat het belangrijk is voor mensen om te weten en wat ze echt nodig hebben in hun werk.
- Hoe zie je de toekomst van retail in vijf tot tien jaar?
– Als we het hebben over de detailhandel in levensmiddelen, danHet hypermarktformat zal uitsterven. Dit kun je nu zien in de Verenigde Staten, hoe grote winkelcentra daar uitsterven, en trouwens ook in Rusland. Wat was voorheen het consumptiepatroon? We gaan naar het winkelcentrum, naar de bioscoop, naar de foodcourt en kopen iets anders. Nu komen we thuis, ivi, Okko, Netflix, Yandex.Eda, Delivery Club, bezorging vanuit een restaurant, online winkelen. We moeten toe naar personalisatie.
- Wat betekent dit voor de consument?
- Man gebruikt wat? Dat hij het zich kan veroorloven en dat is handig voor hem. Daarom is het noodzakelijk om de kosten te verlagen, dezelfde kwaliteit te behouden of te verhogen. Dit is waar personalisatie voor de geest komt.
- Een persoon koopt wat hij zich kan veroorloven. Nu dalen de reële inkomens van de bevolking, dalen de kosten.
— Sla in een dergelijke situatie economische formaten opje beter voelen en groeien. Er zijn twee manieren om veel problemen voor retailers op te lossen. Ofwel automatiseren, ofwel tien extra mensen inhuren. Op de korte termijn is de tweede manier een winnende strategie, omdat integratie duur en tijdrovend is en als er iets misgaat, je je bonus kunt verliezen. Stel je nu voor dat je directeur bent van een afdeling met een hele grote bonus, en die kun je kwijtraken. Het is onduidelijk of je over twee jaar in het bedrijf zult werken als de resultaten van deze automatisering bekend worden, of niet, en ze zullen je daarvoor prijzen. En misschien heb je al een bonus. Daarom nemen we nog tien mensen aan. Maar dit leidt op de lange termijn tot een groot verlies.