Об этом на Fintech Data Day рассказал Игорь Вахламов, управляющий директор Газпромбанка.
Зачем ускорять процессы?
- Оставаться конкурентоспособными и успевать за рынком.
- Быстрее экспериментировать и внедрять изменения.
- Экономить ключевые ресурсы.
За счет чего ускорять?
- Быстрая финансовая оценка эффектов.
- Автоматизация подготовки ТЗ и данных.
- Автокалибровка моделей, подбор сегментов и cut-off.
Почему нужны регулярные обновления
Модели (особенно градиентный бустинг) деградируют: около −0,5 п.п. метрики в месяц и через 4–6 месяцев заметно теряют пригодность из‑за data drift, concept drift и изменений среды.
Как оценить ущерб
Используем финансовую оценку изменения метрики. Имея работающую стратегию и экономику успешных/неуспешных кейсов, можно:
- сгенерировать бутстреп-выборки для варьирования метрик;
- для каждой построить зависимость средней прибыли от метрики и управляемых факторов.
Коэффициент при метрике даст денежный эффект одного пункта. Если он значим, идем дальше.
Постановка задачи
Готовим дизайн-документы, ТЗ, согласования с бизнесом. LLM помогают формулировать цели, источники, таргеты, требования к мониторингу и пр.
Автоподготовка данных
1) Интеграция с источниками и автоматическое извлечение признаков.
2) Проверка качества/стабильности и рекомендации по улучшению.
3) Преобразование и передача данных в модель.
Автокалибровка моделей
- Поиск сегментов для калибровки.
- Выбор методов перехода и их настройка (важно для чувствительных к трендам рисковых моделей).
- Выбор и настройка самих методов калибровки.
Гибкий подбор сегментов
- конструируем искусственную величину, учитывающую и целевой признак, и выход модели, чтобы видеть, где модель сильнее/слабее.
- Обучаем, например, дерево решений на признаках, доступных для сегментации, и автоматически находим сегменты.
Подбор cut-off
- Вариант 1: отсекать максимум при риске не выше порога.
- Вариант 2: оптимизировать recall — найти заданную долю проблемных в отсеченном множестве.
- Вариант 3 (частый в рисках): максимизировать одобряемую популяцию при ограничении на риск.
Гибкая логика по сегментам
- В сегментах с лучшей работой модели — выше cut-off и жестче отсечение.
- В слабых — мягче пороги.
- При высокой доле целевого класса — можно ужесточать отсечение.
Итеративная настройка
- Для каждого сегмента подбираем коэффициент целевой метрики отсечения.
Эффект
- минус 3–5% отказов за счет математических методов ручной настройки.
Мониторинг после внедрения
- Автосбор данных.
- Автодиагностика аномалий и выбросов.
- Предсказательный мониторинг: прогноз индексов стабильности и эскалация только значимых отклонений.
"В будущем моделирования мы ожидаем: различные экосистемы данных, включая генеративные feature store’ы, проактивные дата-пайплайны для переобучения, песочницы для тестов; персонализированные движки (например, продуктовые трансформеры для адаптация предложений под поведение клиента, предсказание событий по жизненным изменениям клиента, а также движение в сторону больших моделей", - поделился в заключение прогнозами Игорь Вахламов.
17 сентября приглашаем вас на Scoring Day - будут обсуждаться не менее интересные темы!