В МФТИ я закрывал курс машинного обучения, в конце которого была защита проектов. Я реализовывал нейросетевое распознование лиц на чем-то типо сиамских сетей, и первый вопрос на защите был - зачем тут нейронки, чем это лучше чем алгоритмы основаные на поиске ключевых точек лица? Тогда я очень удивился вопросу, ведь "нейронки это круто, за ними будущее!".
По итогу этот случай забылся (даже с учетом того, что мне порезали балл из за необоснованости решения) до YML conf.
Там был доклад яндес лавки про то, как они предсказывают необходимое количество товаров для заказа в свои дарксторы, разбросанные по Москве (и не только). Перед докладом я долго обдумывал всякие сложные архитектуры для работы с последовательными данными, думал какой будет лучше. Очень хотелось услышать доклад - ведь яндекс же точно придумает что-то сложное и интересное. Уровень моего разочарования вы можете понять по картинке сверху. Как оказалось ~90% результата дало просто усреднение по последней недели, а ~98% усреднение за месяц с учетом дней недели (то есть в пн усредняем по прошлым понедельникам, итп).
Я понял, что постоянно пытаюсь усложнить задачу, при этом в сторону, которая вообще не нужна бизнесу. В этом случае, можно было бы получить намного больший рост бизнес метрик просто учтя квантование товаров (заказ коробками), канибализацию итп, однако как kaggle млщик (где соревнования происходят в формате все или ничего, твое решение может быть на 0.01% хуже, но ты уже не победитель) смотрел чисто на ML ные метрики.
Про похожую ситуацию и как с этим бороться рассказывал Антон Малцев, советую вам чекнуть)
Post #20
798
- ❤ 8