Привет, это Александр Исаков, руководитель группы прогноза в Яндекс Лавке. Я считаю, что в резюме кандидата должны быть личные проекты: иногда они показывают ваши навыки и умения даже лучше, чем рабочие задачи.
Смело кидайте ссылочку на репозиторий потенциальному работодателю! А если подходящих пет-проектов у вас пока нет, вот несколько занятных идей:
🈂️ Классификация медицинских статей по рубрикам
Данные: PubMed MultiLabel Text Classification Dataset MeSH
Бейзлайн: логистическая регрессия
Что делаем:
🔵 Грузим и готовим данные, ищем пропущенные значения и по возможности обрабатываем. Можно провести нормализацию текста
🔵 На основе текстовых описаний генерируем исходные численные параметры текста. Например, можно посчитать TF-IDF
🔵 Генерируем признаки на основе полученных начальных
🔵 Отбираем признаки, оставляем место только для самых важных
🔵 Разбиваем данные на train / OOS (out-of-sample) / OOT (out-of-time)
🔵 Обучаем базовую модельку логистической регрессии. Как это реализовать, показано вот тут
Как улучшить:
🔵 Использовать деревянные модели: Random Forest Regressor или любой бустинг, имя которого нам нравится
🔵 Копнуть чуть глубже и протестировать, например, нейросети для работы с последовательностями или архитектуры на основе трансформеров. Например, как тут
💎 Скилы, которые можно прокачать: работа с текстовыми данными, Feature Engineering, работа с табличными данными и NLP.
🈂️ Рекомендательная система для фильмов
Данные: MovieLens Dataset
Бейзлайн: матричные разложения (Matrix Factorization). Пример кода есть вот тут
Что делаем:
🔵 Классически собираем данные без обработки
🔵 На их основе строим user-item matrix. Дальше можно обработать данные — допустим, сделать взвешенный рейтинг по числу просмотров
🔵 По возможности засовываем туда SVD (singular value decomposition)
Как улучшить:
🔵 Перейти от матричных разложений к контентным рекомендациям. Например, подгрузить к каждому фильму описание. Или взять другую выборку с информацией об айтемах — например, датасет от Яндекса Yambda-5B (статья тут)
🔵 Взять весь скоуп рекомендательных моделей, про которые слышали, сделать фит-предикт и искать корнер-кейсы для улучшения
💎 Скилы, которые можно прокачать: рекомендательные системы, матричное
разложение, нейросетевые методы работы с рекомендациями.
🈂️ Распознавание объектов на изображениях
Данные: CIFAR-10 Dataset (или любой другой с кагглов)
Бейзлайн: любая (желательно самописная) CNN-сеточка
Что делаем:
🔵 Загружаем и нормализуем изображения
🔵 Строим базовый CNN с несколькими свёрточными и pooling-слоями. Более продвинутые модели можно поискать тут
🔵 Разбиваем данные на тренировку и валидацию
🔵 Обучаем модели с использованием нужного нам лосса, например Cross Entropy Loss
Как улучшить:
🔵 Используйте более сложные модели типа
🔵 Применяйте Transfer Learning с использованием предобученных моделей. Или вообще попробуйте применить CLIP
💎 Скилы, которые можно прокачать: обработка изображений, свёрточные нейронные сети, Transfer Learning.
⏬ А если вам нужны ещё идеи — смотрите мой пост с пет-проектами в геоаналитике со спутниковыми снимками. Удачи!
Подписывайтесь:
💬 @Yandex4Analytics