Каково же решение?
1. Осознай, что просто сбор большого количества данных (так называемых больших данных) обычно порождает больше неопределенностей (и это нормально, это просто факт, мы не используем их в качестве исходных данных в производстве)...
2. Можешь собрать много данных. Но важным шагом является построение процесса дистилляции больших данных в золотые данные, которым можно доверять (в DataWorkshop мы называем их Trusted Data, дело не в размере). Этот процесс - самая большая проблема (кстати, с привлечением ML, а не только человеческого мышления, и это не только про обычный "шум").
3. Думай про это как про итерационный процесс: пробуй, терпи неудачи, учись и продолжай двигаться вперед.
Post #338
473
- 👍 6
- ❤ 2
- 🔥 1