TGViewer
.ml .ml @mltochka · 4.23K subscribers
Post #118 2.58K
Как обучить 66 моделей и не сойти с ума?

Продолжаем серию постов о построении NBA для банковских продуктов. В предыдущем посте мы рассказывали о модели отклика на продукт, которая показывает вероятность подключения без дополнительных коммуникаций.

Так как в банке 66 разных продуктов, то модель отклика нужно построить для каждого. Если делать их руками — подбирать фичи, чистить данные, тюнить гиперпараметры, проверять качество, — уйдёт сотни часов работы дата-сайентистов. Поэтому мы решили автоматизировать процесс.

Использовали библиотеку LightAutoML

Она закрывает большую часть стандартного пайплайна обучения:

• отбирает наиболее значимые признаки;
• обучает несколько моделей параллельно;
• подбирает оптимальные параметры
• объединяет лучшие модели в ансамбль.

По сути библиотека берёт на себя большую часть той работы, которую дата-сайентист выполняет вручную.

Полный цикл обучения занимает около часа. Всё это время модель работает самостоятельно, а инженер может заниматься другими задачами. При этом качество на выходе близко к тому, которого удалось бы добиться при ручной настройке.

Сделали единый Feature Store

На практике самая долгая часть моделирования — это подготовка данных: подсчёт агрегатов, джойны, построение витрин. Если для каждой модели отдельно писать код расчёта признаков и поддерживать десятки разных пайплайнов, система быстро станет неуправляемой. Поэтому мы решил построить единый Feature Store, а в качестве хранилища использовали LakeFS.

Все подготовленные признаки сохраняются в виде parquet-файлов. Благодаря этому каждая модель работает с одним и тем же набором данных и не зависит от того, как именно эти признаки были рассчитаны.

Что это дало на практике?

До автоматизации обучение одной модели занимало несколько недель, теперь — около 2-3 дней. Если по продукту накопилось достаточно данных (от 1000 успешных подключений), то можно быстро подготовить датасет, обучить модель и провести A/B-тесты.

Однако, если подключений слишком мало (например, как у новых продуктов), то модели не хватает данных для обучения. Пока мы ещё ищем решение этой проблемы.

💜 Этот пост написал Евгений Наговицын, ML-разработчик в Точка Банк
  • ❤ 16
  • 🔥 16
  • 👏 7
  • 👍 4
More from @mltochka
  1. Sep 4, 2026Post #126
  2. Sep 4, 2026Друзья, переголосуйте, пожалуйста, в вопросе про контент — сделали множественный выбор
  3. Sep 3, 2026Post #123
  4. Sep 3, 2026Post #122
  5. Sep 3, 2026Опрос о вас 💜 Канал существует уже два года, и нам хочется лучше понимать, кто именно нас…
  6. Aug 28, 2026Почему бизнес в роли заказчика, а ИИ-команда в роли исполнителя — это плохо? Если работает…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →