Большие данные = большие неопределенности (НЕ большая ценность) 🤔.
До сих пор существует большой миф о ценности, которую можно извлечь из больших данных. Давай лучше разберемся, почему это обычно действительно сложно и приносит больше затрат, чем пользы.
Во-первых, нужно помнить, что одна из самых больших проблем при работе с данными - это неопределенность. В бизнесе (даже при выручке в 100 тыс. долл.) неопределенностей очень много.
Несмотря на то что "золотые" данные могут помочь найти ценные сведения и способствовать принятию более эффективных решений, переизбыток собранных данных зачастую порождает больше неопределенности (в результате чего возникает двусмысленность, когда соответствующая информация имеется, но общий смысл остается неизвестным), чем ясности. Но почему?
Краткий ответ:
GIGO (англ. garbage in, garbage out «мусор на входе — мусор на выходе»)
Что дальше?
Существует еще один миф и гонка за сбором "правильных" данных. Почему плохо собирать правильные данные 🤔?
На самом деле правильные данные - это не плохо, но... проблема заключается в том, чтобы понять, для кого они "правильные"? Как расставить приоритеты: какие данные "правильные", а какие нет? Как определить, какие данные работают лучше без предварительного тестирования моделей (а какие применять модели ML, они ведь все время улучшались)?
Почему проблема заключается лишь в том, чтобы время от времени добавлять "очередные нужные данные"? Например, сегодня Ты собираешь данные A и B, а завтра выясняется, что Тебе нужны еще и данные C.
Где проблема? Проблема во времени. Когда начинаешь собирать данные, у Тебя всегда есть начальная точка (иногда можно попытаться найти исторические данные каким-либо способом, но такой подход полон ошибок и подводных камней).
Поэтому, чтобы извлечь из них максимальную пользу (использовать ML-модель и т.д.), обычно необходимо иметь исторические данные.
Post #337
438

- 👍 2