TGViewer
DataWorkshop - AI & ML DataWorkshop - AI & ML @data_work · 1.88K subscribers
Post #337 438
Большие данные = большие неопределенности (НЕ большая ценность) 🤔.

До сих пор существует большой миф о ценности, которую можно извлечь из больших данных. Давай лучше разберемся, почему это обычно действительно сложно и приносит больше затрат, чем пользы.

Во-первых, нужно помнить, что одна из самых больших проблем при работе с данными - это неопределенность. В бизнесе (даже при выручке в 100 тыс. долл.) неопределенностей очень много.

Несмотря на то что "золотые" данные могут помочь найти ценные сведения и способствовать принятию более эффективных решений, переизбыток собранных данных зачастую порождает больше неопределенности (в результате чего возникает двусмысленность, когда соответствующая информация имеется, но общий смысл остается неизвестным), чем ясности. Но почему?

Краткий ответ:
GIGO (англ. garbage in, garbage out «мусор на входе — мусор на выходе»)

Что дальше?
Существует еще один миф и гонка за сбором "правильных" данных. Почему плохо собирать правильные данные 🤔?

На самом деле правильные данные - это не плохо, но... проблема заключается в том, чтобы понять, для кого они "правильные"? Как расставить приоритеты: какие данные "правильные", а какие нет? Как определить, какие данные работают лучше без предварительного тестирования моделей (а какие применять модели ML, они ведь все время улучшались)?

Почему проблема заключается лишь в том, чтобы время от времени добавлять "очередные нужные данные"? Например, сегодня Ты собираешь данные A и B, а завтра выясняется, что Тебе нужны еще и данные C.

Где проблема? Проблема во времени. Когда начинаешь собирать данные, у Тебя всегда есть начальная точка (иногда можно попытаться найти исторические данные каким-либо способом, но такой подход полон ошибок и подводных камней).

Поэтому, чтобы извлечь из них максимальную пользу (использовать ML-модель и т.д.), обычно необходимо иметь исторические данные.
  • 👍 2
More from @data_work
  1. Jul 16, 2025Помнишь, как прятали невидимые команды (prompt injection) в статьи на arXiv, чтобы влиять…
  2. Jul 14, 2025👆👆👆 Исследователи из 14 университетов (в том числе ведущие учреждения!) начали “взламыв…
  3. Jul 14, 2025Думаешь, что схитришь, поручая ИИ читать 100-страничные отчеты? Что может пойти не так, пр…
  4. Apr 7, 2025👆👆👆 (часть 1) Теперь конкретно, по моделям: 1️⃣ Llama 4 Scout: Это «младшая» версия с 1…
  5. Apr 7, 2025🚨 Вышла Llama 4 — проверил лично и делюсь впечатлениями! 🔥 TLDR: Давно ждал Llama 4 — и…
  6. Apr 6, 2025Закончился первый поток курса "Практический LLM". В нём прежде всего уделяется больше вним…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →