💡Однажды я участвовал в проекте по диагностике электролизеров на производстве ядерного топлива. Электролизеры совсем как в школе на уроках физики и химии, только побольше и подороже. Об этом проекте я рассказывал на AI Journey, но в рассказе акцентировал внимание на менеджерской и безнесовой частях проекта. Кстати, в те времена я еще волновался во время выступлений, хотя это и было онлайн.
Что касается data science части, то в рамках проекта успели попробовать почти все подходы к решению задачи поиска и прогнозирования аномалий:
• эвристики, экспертные правила, оценки распределений и других статистических характеристик сигналов. Сюда же относятся некоторые статистические критерии, типа Хотеллинга, cusum, ewma, проверяющие гипотезы об изменениях статистических характеристик сигналов.
• Supervised классификация каждой точки. Если есть разметка для всех моментов времени, можно поставить задачу как бинарную (или многоклассовую) классификацию, определяя класс каждой точки в выборке. Обычно осложняется отсутствие правильной разметки.
• Supervised классификация интервалов. Указание, какой интервал является аномальным, а какой нормальным. Можно применять на скользящем окне, если задача состоит в том, чтобы указать будет ли аномалия в какой-то (следующий) период времени. Так же бывают проблемы с разметкой.
• Semi-supervised подход. Построение модели нормального режима работы, после чего использовании этой модели для поиска отклонений от нормального режима. Если модель уловила закономерности в норме, то в случае возникновения аномалий закономерности будут другими и модель будет сильно ошибаться, а разница между моделью и реальными данными будет значительной. Подход очень распространен, так как нужна всего лишь разметка нормального режима работы, которая бывает доступна довольно часто.
В данном случае как раз первый подход был лучшим среди всех, не считая ансамблей на основе разных подходов. Но более подробно об этом я еще возможно когда-нибудь расскажу в научной или технической статье. Конечно, обезличенно.
Кстати, этот и другие кейсы применения data science и машинного обучения в промышленности можно найти в этом репозитории на гитхабе.
Post #26
1.18K