Предиктивная аналитика эксгаустеров. Часть 2
Продолжение этого поста
В промышленных проектах часто есть соблазн взять большое число доступных данных и поробовать поприменять на них современные архитектуры нейронок, поимплементировать подходы из научных статей, пособирать необычные пайплайны и ансамбли алгоритмов. Когда я занимался ресерчем более активно — сам любил так делать 🤤. Но с опытом пришло осознание, что нужно стремиться к упрощению моделей и подходов, чтобы обеспечить прозрачность и простоту решения. Сложность и интерпретируемость решения сильно коррелирует с принятием и доверием к решению на производстве. Поэтому большая часть времени работы над решением приходится на обработку данных (помните: garbage in-garbage out), а не на разработку сложного алгоритма решения задачи.
Идеальный сценарий:
много времени потрачено на подготовку данных, генерацию физически обоснованных признаков и эвристик, используемых экспертами и технологическим персоналом на производстве, а в качестве модели выбрана линейная модель, на которой легко объяснить причину принятия того или иного решения.
💻 Так и в этом кейсе с эксгаустерами во время конкурса мы уделили довольно много времени следующим аспектам:
• Переразметка инцидентов (ручная проверка КАЖДОЙ аномалии и попытка определить реальный момент возникновения и устранения аномалий)
• Фильтрация инцидентов из журнала ТОиР (плановые работы, непрогнозируемые аномалии, неправильно размеченные кейсы)
• Подготовка к обучению модели (ресэмплирование, подбор оптимальной стратегии заполнения пропусков, очистка данных, выделение нормальных режимов по электрическим и вибрационным параметрам)
• Генерация дополнительных признаков (отклонение вибрация, температур от медианного значения, тренды и др.)
• Формирование правильных и честных обучающих и тестовых выборок, без пересечения, заглядывания в будущее и тд.
Также часто говорю, что возможностью обучения подходов и алгоритмов с учителем (supervised) стоит пользоваться, они часто бьют скор подходов без учителя/частичного обучения с учителем (unsupervised/semi-supervised), вот, кстати, самый популярный. Но не забывайте, что требования к количеству и качеству разметки возрастают!
Однако интересно познакомиться с противоположным подходом к решению задачи! Статья и репозиторий с непростым решением задачи с того же конкурса (ансамбль, нейронки, эвристики, все как мы любим) + описание данных и сами данные (надо только хорошо поискать ссылки в репозитории). Публично доступные данные с реальных производств мы не упускаем из виду, обязательно сохраняем, пригодятся 🌍. А теперь вы и сами можете попробовать решить задачу — все для этого есть!
Post #87
2.13K
Telegram Katser
- 👍 17
- 🔥 4
- ❤ 2
- ❤🔥 1
- 👏 1