"1.5 배 더 많은 상점을 개설하면 20 % 성장이 쉽습니다."
— 당신의 연설에서 당신은
— X5의 매출은 계속 증가할 것입니다.일반적으로 시장은 소매업 통합을 향해 움직이고 있습니다. 현재 우리의 주요 소매업체 3곳이 시장의 약 20%를 점유하고 있으며 선진 자본주의 국가에서는 이 점유율이 약 70~75%에 이를 것으로 예상됩니다.
평균적으로 매일 X5는 6 개의 새로운상점. 우리가 의사 소통하는 동안, X5는 새로운 상점을 엽니 다 (웃음). 실제로 다른 시장 플레이어와는 달리 상황이 잘 진행되고 있습니다. 열린 데이터를 살펴보면, 그 중 하나를 사용하면 12 %의 면적이 증가하고 매출은 84 % 증가합니다. 셀 수 있습니다 : 그들은 부정적으로 작동하기 시작합니다. LFL과 같은 지표가 있습니다. 비슷한 경우처럼, 같은 상점을 1 년에 비교합니다. X5에서는 작지만 플러스입니다. 즉, 매장 수를 1.5 배 더 늘리면 20 %까지 성장하기 쉽지만 실제로는 마이너스 성장입니다. 오래된 상점이 더 잘 작동하고 새 상점이 열리기 때문에 자라는 경우 이는 매우 긍정적입니다.
- 어떻게 생각하니,이 점에서 팀의 장점 중 어떤 부분이 공유 되나요?
— 아직 규모가 크지는 않습니다.결성된 지 얼마 되지 않았습니다. 솔직히 말해서 2017년 X5의 성장은 2018년에 창설된 팀의 도움으로 데이터 분석을 적용한 덕분이 아닐 것 같습니다.
우리 이사장은 X5 회사 창립에 참여한 Anton Mironenkov입니다. 그는 Perekrestok과 Pyaterochka의 합병에 참여했으며 그 후 X5가 등장했습니다.
빅데이터의 방향을 고민합니다전략적. 소매업의 미래는 소매업체가 프로세스를 최적화하고 고객 경험을 개선하기 위해 매일 대량으로 생성되는 데이터를 수익화하고 사용하는 방법을 얼마나 빨리 배우는지에 달려 있습니다. 따라서 우리는 이 모든 것을 별도의 방향으로 분리하고 더 빠르게 발전할 수 있도록 더 집중하기로 결정했습니다.

Anton Mironenkov, Big Data X5 책임자
이 부서 내에서 우리는 우리 자신의 역량을 가지고 있습니다.클러스터, 개발자, 테스터, 분석가, 프로젝트, 제품 등 필요한 모든 것. 우리는 이미 몇 가지 일을 해왔으며, 이는 1년도 채 안 되는 기간 동안 많은 진전을 이루었습니다. 우리는 회사에 상당히 큰 이익을 안겨줄 것이라는 것을 분명히 이해하고 있지만, 이러한 결과는 1년 후에야 볼 수 있습니다.
수표의 모든 정보 - 보드카를 구입 한 경우 만 18 세 이상입니다.
- 내가 "교차로"에 와서 물건을 사면, 분석을 위해 무엇을 가져갈 것입니까?
- 확인해. 당신의 제품은 당신을 아주 잘 특징 짓습니다. 기저귀를 사면 아마 작은 아이가 생길 것입니다. 보드카라면 18 세 이상입니다. 한 사람이 칩을 살 수 있고 16 세의 십대라고 확신 할 수 있습니다. 그리고 일기를 구입 한 경우, 귀하 또는 귀하의 가족 중에 7 세에서 17 세 사이의 자녀가 있습니다. 이것은 많은 정보입니다.
상상해보십시오. 당신은 가게에 와서, 일부 제품을보고 가게가 비싸거나 싸거나 중간 가격대라는 것을 이해합니다. Pyaterochka에는 4 천에서 8 천 가지의 독특한 제품이 있습니다. 당신이 수첩을 가지고 가서 많은 물건들에 대한 가격을 기록한 다음, 도시의 물건들에 대한 평균 가격을보고 결론을 이끌어 내기 란 거의 불가능합니다. 5 ~ 10 개의 제품을 살펴보십시오. 그래서 어떤 제품을 보는지, 우리도 관여합니다.
사람들이 보는 제품도 함께 바뀝니다.시간이 지남. 간단한 예 : 20 년 전에는 모바일 통신과 관련된 제품이 없었습니다. 이제 모든 매장에서 판매 할 수는 없지만 SIM 카드를 구입하십시오. 20 년 전 러시아에서는 일반적으로 지금보다 조금 더 힘들었고 소비는 완전히 달랐습니다.
- 할인을 제공하는 고객 프로필을 만드는 방법은 무엇입니까?
- 고객 프로필과 충성도의 두 가지 제품이 있습니다. 클라이언트 프로파일은 마크 업이없고 다른 접근법을 사용할 때 그러한 작업입니다. 우리는 클러스터링에 대한 다양한 접근법을 사용합니다 - 표준 통계에서 시작하여 중간 속도로부터의 튼튼한 편차와 Word2vec로 끝나고 수표에 겹쳐지며 사람을 Word2vec를 통해 TF-IDF를 통해 평균화 된 벡터 형식으로 "번역"합니다.
Z-점수, Z-점수- 다음을 표현하는 통계적 추정치데이터 세트의 평균에서 특정 수준까지의 거리(표준편차로 측정)입니다. 특히, Z-점수는 회사의 신용도와 파산 위험에 대한 산출 척도입니다.
영어와의 견고한 편차. 강력하고 견고한 "견고한"- 데이터의 배출과 관련한 견적의 안정성. 중앙값과 관련하여 고려됩니다.
Word2vec단어를 벡터로 표현할 수 있는 도구입니다.
TF-IDF- 텍스트 모음에서 단어의 중요성 정도를 나타내는 통계 용어입니다.
당신이 만드는 모델이 있다면개인 제안서를 작성한 다음 속성을 추가 한 후에 모델의 품질이 향상되면 클러스터링이 성공했다고 가정합시다. 여기서 경제적 효과와 어떤 종류의 통계를 계산할 수 있습니다.
- 귀하의 제품은 어떤 매장에서 사용 되었습니까?
- 모두요.우리는 14,000개 X5 매장 전체에서 그 효과를 이해하기 위해 50만 명의 사용자를 대상으로 맞춤형 할인을 테스트했습니다. 우리는 이러한 모든 매장으로부터 대화형 보고를 수집합니다. 모든 매장에서 사용 가능한 프로모션 제품이 있습니다. 우리는 구색 매트릭스와 수요 예측을 가지고 있습니다. 그들은 첫째로 가게에 닭고기가 있는지, 둘째로 닭고기가 썩지 않았는지 확인합니다.
이제 컴퓨터 비전을 시작해 보겠습니다.처음에는 모든 매장에서 사용할 수 없습니다. 가장 큰 것부터 시작해 보겠습니다. 해당 항목에서만 테스트하는 것이 좋습니다. 작업은 매우 간단하며 이점은 분명합니다. 제품이 있고, 선반에 없을 수도 있지만 창고에 있을 수도 있으며, 그 순간에는 제품이 구매되지 않습니다. 이것은 매우 나쁘다. 가게에서 샀는데 팔 수가 없어요. 가장 좋은 경우에는 사용자가 그 제품을 사지 않을 것이고, 최악의 경우에는 돌아서서 떠나게 될 것이다. 왜냐하면 세 가지 제품 중 두 개를 살 곳으로 와서 다른 상점으로 갈 필요가 없기 때문이다. 세 번째. 그는 모든 것을 살 수 있는 가게로 곧장 올 것입니다. 그리고 이것은 컴퓨터 비전을 사용하여 해결됩니다. 카메라가 배치되어 제품이 거의 남지 않았음을 감지합니다. 이에 대한 책임이 있는 사람에게 알림이 오고 그는 이 제품을 구입하기 위해 창고로 이동합니다.
두 번째 작업은 차례입니다. 우리는 상점에 대기열이 있음을 알고 있습니다. 당신이 줄을 서서 불만을 가지고 있고 아무도 좋아하지 않는 시간을 낭비하거나, 가게에 가서 대기열을보고 돌아 서서 떠나십시오. 대기열의 원인이 상태가 부족하다고 판단되면 아무 것도 수행 할 수 없습니다. 조건부 영업 사원이 등 뒤에 앉고 차를 마시고 차를 마시는 것이 문제라면 이사가 그녀에게 전화를 겁니다. 상점은 이미 라인에 있으며 도달 할 때까지 컴퓨터에 앉아서 켜고 계산원을 끌어 당기고 시간이 지날 것입니다. 그녀를 아직도 보면서, 그녀는 너무 긴장합니다. 이 출납원은 대기열이 형성되기 전에 밖으로 나가야하므로 출구 시간에 사람들은 이미 출납원에게갔습니다. 컴퓨터 비전을 사용하여 쉽게 해결할 수 있습니다.
약 150에서 테스트할 예정입니다.상점, 그리고 아마도 모스크바에 있을 가능성이 높습니다. 첫째, 우리 자신은 모스크바에 있고 둘째, 여기에는 교통량이 더 많습니다. 그러면 사용자 경험을 개선하는 방법과 X5의 이점이 무엇인지 명확해질 것입니다.
"나는 정말로 데이터 과학자라는 말을 좋아하지 않는다."
- 너의 경영을 확장 시키니?
- 물론 관리자들은 우리가 결과를 내고 있음을 알 수 있습니다. 잘 작동하지 않으면 아무도 팀을 두 번 확장 할 수 없습니다. 그 자체로,이 사실은 우리의 효율성을 말해줍니다.
- 네가 일하는 사람이 32 명이고, 몇 명이나 더 모집 하겠니?
- 아직도 어딘가 20-30. 우리는 이제 내 경영의 일환으로 컴퓨터 비전 및 음성 기술을 사용할 것입니다. 두 개의 새로운 부서가있을 것입니다. 즉, 이것은 10 명을 더한 것입니다. 내 의견으로는 내년에 또 다른 10-15 명이 동의됩니다. 소위 프로젝트 률이 있습니다. 우리는 30-36 플러스, 60 명 이상 어딘가에있을 것으로 예상합니다. 특히 데이터 분석 및 기계 학습에 종사하는 사람들입니다.
- 누가 너를 초대하니?
— 저는 '데이터 과학자'라는 단어를 정말 좋아하지 않습니다.아무런 정보도 담고 있지 않기 때문입니다. 데이터 과학자를 찾고 있는 회사가 10개 있는데, 이는 완전히 다른 10개의 직책이 될 것입니다. 나는 "분석가"라는 단어를 좋아합니다. 내 부서 이름은 자명합니다. 기계 학습 부서, 데이터 분석 부서, R&D 그룹, 즉 연구, 컴퓨터 비전 부서, 음성 기술 부서 및 이러한 문제를 해결하기 위한 비제품 분석 그룹이 있습니다. 기존 제품 방향에서 벗어난 것입니다.
나는 프로그램 할 수있는 사람들을 찾고있다.파이썬은 확률 이론과 수학 통계를 알고, 모델링이 필요하다면 기계 학습 기술이 필요합니다. 그러나 가장 중요한 것은 생각하고 분석 할 수있는 사람의 능력입니다. 나는 분석적 사고와 비판적 사고가 가르치는 것이 매우 어렵다는 생각이 점점 더 많아졌습니다. 20 ~ 25 년이 지난 지금 이미 일부 세계관이 있다면, 변화가 없을 것입니다.
- X5에서 이걸 이해 했니?
- X5가 나를 이끄는 건 아니지. 나는 또한 사람들을보고 의사 소통하며 그들이 어떻게 일하는지 보았다. 아시다시피, 최선의 인터뷰는 시범 기간입니다. 그리고 어떤 시점에서 이것은 단순히이 사람이 아니라는 것을 알 수 있습니다. 즉, 그는 mekhmat를 졸업 한 것으로 보이는데, 그는 바보가 아니라 그가 아닌 것처럼 보입니다. 옳은 태도는 보이지 않습니다. 그것은 Daniel Kaneman의 저서 "Thinking, Fast and Slow"에서 비판적 사고에 해당하는 것을 묘사했습니다. 이것은 세계에 대한 비관적 인 견해를 포함하며, 불행히도 다행스럽게도 획득 한 것보다 타고난 품질입니다.
- 애널리스트가 도착하면 시험 사용 기간이 끝난 후 자신이 적합하다는 것을 알게되며, 사람은 무엇을 기대할 수 있습니까?
- IT에는 일반적으로 주니어, 중학교, 중학교 등의 등급이 있습니다.선배이자 연습생. 위에서는 거의 발견되지 않습니다. 이것은 직원이나 리더입니다. 나는 고위직에 인플레이션이 있다고 믿습니다. 우리에게는 많은 직위가 있지만 실제로 평균 중간 직위에 도달하는 경우는 거의 없습니다.
시장에서 평균 급여를받는다면, 주니어한달에 세금이 부과되는 중간 120,000 ~ 150,000 루블 중 한 곳에서 25 만 루블을 받고 시니어는 약 40 만 루블을 받는다. 상단 바 : 나는 개인적으로 수석 개발자의 손에 그 제안을했다, 그것은 600,000 루블 이상이었다.
"데이터 과학은 실제로 어떤 종류의"케이크에 벚꽃 "입니다."
— 머신러닝은 어떻게 시작하게 됐나요?
— 대학에는 컴퓨터 과학이 전혀 없었습니다.훈련. 제가 2012년에 대학을 졸업했기 때문에 비슷한 시기에 관련 일이 또 한 번 늘었습니다. 시간이 없었어요. 두 대학을 졸업했으며 마지막 대학은 카를스루에 응용과학 대학에서 메카트로닉스 석사 학위를 받았습니다. 그 전에는 현재 모스크바 폴리테크닉(Moscow Polytechnic)으로 불리는 모스크바 화학공학 연구소(Moscow Institute of Chemical Engineering)에서 공부했습니다. 나는 거기나 거기에서 기계 학습에 관여하지 않았습니다.
웃기는 일 : 이제는 데이터 과학을 완성한 사람들의 인터뷰 담당자이며, 물리, 공학, 컴퓨터 과학을 졸업 한 사람들보다 자신의 레벨이 약하고 낮아진 것 같습니다. 어쩌면 이것은 약간의 변화 일 것입니다. 왜냐하면 스스로를 배운 사람들은 처음에 강하고 새로운 것을 배웠기 때문입니다. 그리고 데이터 과학은 실제로 어떤 종류의 "케이크에 벚꽃"이며, "케이크"자체가 없지만 "체리"가 있다면, 이것은별로 흥미롭지 않습니다.
- 어떻게 이걸 배웠어?
— Coursera에는 두 가지가 있다는 옛말이 있습니다.진지한 코스, 심지어 1.5분이라도. 이것은 기계 학습 및 신경망에 대한 Hinton의 과정(이 과정은 Coursera에서는 더 이상 제공되지 않지만 YouTube - Hi-Tech에서 볼 수 있음)과 확률적 비그래픽 모델에 대한 Daphne Koller의 과정입니다.
콜러 코스는 비디오 강의이며,그녀는 스탠포드 대학원생들에게 읽습니다. 그러므로 그를 완전히 진지하게 부를 필요는 없다. Hinton의 코스는 16 주간 지속되며, Koller는 5 주에서 6 주까지 3 코스가 있습니다. 그리고 그 힘을 주먹으로 모으고 첫 번째 코스를 밟아 두 번째와 세 번째 코스가 통과 할 준비가되지 않았다는 것을 깨달았습니다.
그러나 Coursera가 유일한 옵션은 아닙니다.나는 책을 많이 읽었습니다. 그건 그렇고, 나는 이제 통계에 관한 Bradley Efron의 책을 마쳤습니다(미국 통계학자, 미국 국립 명예훈장 수상자 - 미국 과학자들에게 가장 높은 주상인 "하이테크"). 그 전에 Ian Godfellow(미국의 기계 학습 전문가, Google Brain - Hi-Tech에서 근무)가 쓴 딥 러닝에 관한 책입니다. 그것은 지속적인 학습 과정입니다. Coursera는 하나의 리소스일 뿐이고 Kaggle(정기적으로 대회를 주최하는 온라인 컴퓨터 과학 커뮤니티 - "하이테크")도 있지만 가장 중요한 것은 읽고, 읽고, 확인하는 것입니다. 읽고 이해하지 못한다면 그것은 나쁜 것입니다. 그것이 어떻게 작동하는지 이해한다면 무엇이든 할 수 있습니다.
구구단과 같습니다.어떤 사람이 구구단을 이해하지 못하지만 마음으로 배웠다고 상상해 보십시오. 그들은 그에게 “6x6이요?”라고 묻습니다. - "36". - "7시 8시요?" - "56". - “좋아요, 마지막 질문은 10시부터 11시까지요?” — 그 남자는 이렇게 말했습니다. “모르겠어요. 구구단에는 없었거든요.” 그게 다야. 제가 자주 만나는 사람들이 바로 이 사람들입니다. 10 x 11은 계산하기가 훨씬 쉽지만 표에는 없으므로 원리를 이해해야 합니다. 원리를 이해하면 모든 것이 훨씬 쉬워질 것입니다.
그 밖의 모든 것은 그 사람에 달려 있습니다. 우리 스스로 어떤 것을 배울 것 같습니다. 우리는 단지 다른 사람들을 돕고 방해하지 않습니다. 이 모든 것은 자기 훈련의 문제입니다.
— HSE의 데이터 과학 과정에 대해 알려주십시오.
- 이것은 무료 코스입니다, 그것은 표준 내에 있습니다프로그램, 그것에 나는 많은 사람들을 위해 - 계시의 기본적인 단순한 것들을 말합니다. 예를 들어, 측정 항목은 무엇이며, 무엇이 존재하는지, 어떻게 다를 지, 어떤 경우에 A / B 테스트인지에 대한 아이디어를 테스트하는 방법 등이 있습니다. 이것은 사람들이 자신의 일에 정말로 필요로하는 것이 무엇인지를 아는 것이 중요하다는 것을 나 자신이 내놓은 것입니다.
- 5 년에서 10 년 후에 소매의 미래를 어떻게 볼 수 있습니까?
— 식품 소매에 관해 이야기한다면,대형마트 형식은 사라질 것입니다. 이것은 이제 미국에서 볼 수 있습니다. 얼마나 큰 쇼핑 센터가 그곳에서 사라지고 있는지, 그런데 러시아에서도 마찬가지입니다. 이전의 소비 패턴은 어땠나요? 우리는 쇼핑몰, 영화관, 푸드코트에 가서 다른 것을 삽니다. 이제 집에 돌아옵니다. ivi, Okko, Netflix, Yandex.Eda, Delivery Club, 레스토랑 배달, 온라인 쇼핑. 우리는 개인화를 향해 나아가야 합니다.
- 소비자에게 무엇을 의미할까요?
- 남자가 뭘 사용하니? 그에게는 그가 가질 여유가 있으며 그에게 편리합니다. 따라서 비용을 줄이거 나 동일한 품질을 유지하거나 높이는 것이 필요합니다. 이것은 개인화가 떠오르는 곳입니다.
- 사람이 감당할 수있는 것을 사십시오. 현재 인구의 실질 소득은 감소하고 있으며 비용은 감소하고 있습니다.
— 이런 상황에서는 매장경제 포맷이기분이 좋아지고 성장합니다. 소매업체의 많은 문제를 해결하는 방법에는 두 가지가 있습니다. 자동화하거나 10명을 더 고용하세요. 단기적으로 두 번째 방법은 승리하는 전략입니다. 통합에는 비용이 많이 들고 시간이 많이 걸리며 문제가 발생하면 보너스를 잃을 수 있기 때문입니다. 이제 당신이 매우 큰 보너스를 받는 부서의 책임자이고 그것을 잃을 수도 있다고 상상해 보십시오. 이 자동화의 결과가 알려지는 2년 후에 회사에서 일할 것인지 여부는 불분명하며 그들은 당신을 칭찬할 것입니다. 그리고 이미 보너스를 받았을 수도 있습니다. 따라서 10명을 더 채용하고 있습니다. 그러나 이는 장기적으로 큰 손실을 가져온다.