Hogwarts для аналитика данных?
Продолжаем разбирать источники, где можно получить датасеты без регистрации и смс. Сегодня посмотрим на один из наименее рекомендуемых — UCI Repository
UCI Machine Learning Repository — это крупная коллекция датасетов для обучения и исследования алгоритмов машинного обучения, поддерживаемая Университетом Калифорнии в Ирвайне.
У этого источника есть несомненные плюсы:
— большая коллекция классических датасетов (самым первым идёт Iris Dataset);
— представлены разнообразные домены: медицина, биология, социология, физика и др.
Но количество минусов, на мой взгляд, перевешивает (с точки зрения аналитика данных):
— это не «боевые данные»: многие датасеты маленькие (сотни — тысячи строк) и не похожи на реальные;
— данные уже «вылизаны» и подготовлены для загрузки в модели;
— часть датасетов очень старая (90-е / 2000-е годы) и не соответствует современным реалиям.
Хотя из таких датасетов можно слепить что-то пригодное для тренировки, если добавить в них шум, пропуски, лаги по загрузке и другой мусор, на который только способна ваша фантазия.
И это идеальная задача для любимых чат-ботов:
— выбираем домен, в котором хотим практиковаться;
— уточняем у ИИ, какие обычно бывают проблемы с данными в этом домене / области;
— просим ИИ составить план «ухудшения» данных — и вперёд, к генерации.
Но есть одна загвоздка: при малой насмотренности можно сгенерировать ерунду вместе с ИИшкой.
Я бы на данном этапе просто игнорировала этот источник данных. Мне кажется, он не для новичков, особенно если вы хотите «реальные данные» пощупать. Этот репозиторий больше подходит для академических задач. Поэтому предлагаю оставить его ML-щикам.
💬 Колитесь, кто работал с датасетами «Ирис» или «Титаник»?
#аналитик_ищет_данные
#где_мои_данные_чувак
Post #107
961

- 👍 10
- ✍ 6
- 🤓 4