TGViewer
Katser Katser @datakatser · 2.18K subscribers
Post #87 2.13K
Предиктивная аналитика эксгаустеров. Часть 2
Продолжение этого поста

В промышленных проектах часто есть соблазн взять большое число доступных данных и поробовать поприменять на них современные архитектуры нейронок, поимплементировать подходы из научных статей, пособирать необычные пайплайны и ансамбли алгоритмов. Когда я занимался ресерчем более активно — сам любил так делать 🤤. Но с опытом пришло осознание, что нужно стремиться к упрощению моделей и подходов, чтобы обеспечить прозрачность и простоту решения. Сложность и интерпретируемость решения сильно коррелирует с принятием и доверием к решению на производстве. Поэтому большая часть времени работы над решением приходится на обработку данных (помните: garbage in-garbage out), а не на разработку сложного алгоритма решения задачи.
Идеальный сценарий:
много времени потрачено на подготовку данных, генерацию физически обоснованных признаков и эвристик, используемых экспертами и технологическим персоналом на производстве, а в качестве модели выбрана линейная модель, на которой легко объяснить причину принятия того или иного решения.


💻 Так и в этом кейсе с эксгаустерами во время конкурса мы уделили довольно много времени следующим аспектам:
• Переразметка инцидентов (ручная проверка КАЖДОЙ аномалии и попытка определить реальный момент возникновения и устранения аномалий)
• Фильтрация инцидентов из журнала ТОиР (плановые работы, непрогнозируемые аномалии, неправильно размеченные кейсы)
• Подготовка к обучению модели (ресэмплирование, подбор оптимальной стратегии заполнения пропусков, очистка данных, выделение нормальных режимов по электрическим и вибрационным параметрам)
• Генерация дополнительных признаков (отклонение вибрация, температур от медианного значения, тренды и др.)
• Формирование правильных и честных обучающих и тестовых выборок, без пересечения, заглядывания в будущее и тд.

Также часто говорю, что возможностью обучения подходов и алгоритмов с учителем (supervised) стоит пользоваться, они часто бьют скор подходов без учителя/частичного обучения с учителем (unsupervised/semi-supervised), вот, кстати, самый популярный. Но не забывайте, что требования к количеству и качеству разметки возрастают!

Однако интересно познакомиться с противоположным подходом к решению задачи! Статья и репозиторий с непростым решением задачи с того же конкурса (ансамбль, нейронки, эвристики, все как мы любим) + описание данных и сами данные (надо только хорошо поискать ссылки в репозитории). Публично доступные данные с реальных производств мы не упускаем из виду, обязательно сохраняем, пригодятся 🌍. А теперь вы и сами можете попробовать решить задачу — все для этого есть!
Telegram Katser
  • 👍 17
  • 🔥 4
  • ❤ 2
  • ❤‍🔥 1
  • 👏 1
More from @datakatser
  1. May 17, 2026Поделюсь хорошими новостями: я вывалился за правую границу графика (8 лет с начала PhD про…
  2. Nov 1, 2025Ищу к себе в команду Пост от Иры - Senior DS (LLM Engineer). Автоматизация бизнес-процессо…
  3. Nov 1, 2025Вакансии❗️ ПС Senior DS (LLM Engineer) ко мне, поэтому можете писать с вопросами мне напря…
  4. Sep 27, 2025Каминг-аут Как за последнее время пошутили несколько коллег и знакомых: «Ну когда уже сове…
  5. Aug 27, 2025Скоро расскажу, как я сменил промышленность на другую отрасль экономики, но пока делюсь па…
  6. Aug 4, 2025👨От хакатона до автоматизации флотации: путь в промышленный AI Дисклеймер: Триумфальное в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →