TGViewer
ML for Value / Ваня Максимов ML for Value / Ваня Максимов @ml4value · 5.69K subscribers
Post #365 4.5K
Моя первая работа

Мало кто знает, но мое первое место работы случилось ~9 лет назад в рисерче в антифроде (хоть я тогда и не знал этого термина). Да не в обычном, а в антифроде банков. На дворе 2016 год, идет охота на ведьм недобросоветсные банки. ЦБ отзывает лицензии у ~100 банков в год. Всех очевидных мошенников уже закрыли - хочется знать, как найти более хитрые недобросовестные банки для проверок? Тут на помощь приходит ML - прогнозируем будущую вероятность дефолта банка. Обычно за месяц до дефолта банк просто мега-хорош по фин отчетности, а после - хоп, и "дыра" в фин балансе на пару ярдов. То есть банки подделывают/играются с фин отчетностью (фродят)

Сфера с токи зрения ML очень академическая, во всех статьях используют лог-регрессию на вероятность дефолта. Ну и конечно с анализа этих статей я и начал. Тут же нашел там просто к-к-комбо из красных флагов

🚩 В 99% статей метрики качества считаются на трейне (прям как у некоторых llm сейчас 😅)
🚩 В качестве метрики используют ROC-AUC, хотя тут явно нужно что-то вроде precision/recall или даже precision/recall at X
🚩 На инференсе порог вероятности для дефолта... 50%. Его просто никто не подбирал

Из зеленых флагов - есть действительно занятные фичи фрода. Ну что ж, засучим рукава, и попробуем повторить результаты статей с нормальными ml-метриками на train/val/test split по времени и прочими уже стандартами в 2025 г

Выяснилось, что практически для всех статей test precision = recall = 0 🧐

Вооружаемся регуляризацией, балансировкой классов, катбустом и фича инжинирингом - получаем на тесте уже что-то приличное.
Для "быстрой ручной проверки" с высоким порогом вероятности будущего дефолта precision ~87% при recall ~23%.
Для "вдумчивой ручной проверки" и среднего порога precision ~30%, recall ~70%

Дополнительно смотрим на feature importance: все супер, в топе много фичей, которые экономически обоснованы и появляются часто в достойных статьях. Из занятного, >50% feature importance давали фичи
- ликвидности активов (как быстро банк может продать активы)
- доля ритейл-компаний в кредитном портфеле (да, комерсам давать было деньги опасно)
- доля выданных кредитов, которая плохо обеспечена активами банка (выдают кредиты всем подряд)
- обьем зарубежных операций VS активы (отмывание денег)

Интересно, что доля банка на рынке не так сильно влияла на вероятность дефолта. Еще и некоторым топовым банкам модель выдавала вероятность дефолта сильно больше 0%. Но потом все встало на свои места: началась санация (отзыв лицензии) одного из топ-5 банков "Открытие". Занятно, что по модельке его вероятность дефолта =20% за полгода до начала санации и ~70% за 2 мес. В общем, случилось довольно интересное приложение науки к реальности 👨‍🔬

А какие необычные места работы были у вас в начале карьеры?
Пишите в комменты: по моему опыту, часто это годные куллстори 🔽
#personal
  • 👍 64
  • 👏 5
  • 🤓 4
  • ❤ 1
More from @ml4value
  1. Sep 17, 2026Post #496
  2. Sep 14, 2026ML вообще работает? (эпизод 1) Давно не писал в канал. Понял, что сейчас сфокусирован на д…
  3. Jun 12, 2026The art of a strong baseline За последнее время все чаще понимаю, что создать сильный бейз…
  4. May 2, 2026Начинать писать после перерыва всегда непросто, поэтому пока легкий пост про мои новости)…
  5. Mar 29, 2026LLM - велосипед в новой обертке Холиварный пост выходного дня) Доля правды в этом есть - и…
  6. Mar 27, 2026LLM долгосрочные интересы пользователя Понемногу LLM-ки находят полезное применение в реко…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →