TGViewer
Лидерство и ИИ [Артем Бондарь] Лидерство и ИИ [Артем Бондарь] @artemonml · 835 subscribers
Post #22 454
Метрики

Как оно обычно бывает. Приходишь ты в новую ИИ/МЛ команду, спрашиваешь о целях и достижениях, а тебе в ответ на полном серьезе «мы вырастили горох ndcg на 0.08. В следующем квартале еще на 0.05 подрастим». Ничерта не понимаете в рексистемах и что это такое? Вот я понимаю, а мне все равно это не говорит ни о чем. И даже их бизнесовому руководителю ни о чем не скажет. Но никто конфузиться не хочет, все кивают головой, вместо того чтоб спросить «и че мне с твоего 5 эн ди си джи». Почему так?

Моя гипотеза: есть физически интерпретируемые метрики и есть абстрактные математические. По первым можно ставить цели и достигать результатов, вторые берут в отсутствии первых. И юные млщики регулярно подменяют первые вторыми.

Выручка, средний таймспент, вероятность события - все это понятно как пощупать. Выручку сравнить с цифрой зп, таймспент со своим экранным временем в телефоне, вероятность с подкидыванием кубика. Что-то специфичное, типо оборачиваемости в екоме, чуть сложнее понять на кончиках пальцев, но если понял, то понял. И в таких попугаях все цели понятны: вот на сколько метрику улучшил, на столько у тебя и карман потяжелел.

Млщики же знакомятся с метриками по учебникам. Там тоже есть физические метрики вроде accuracy. Понятно как интерпретировать: взял 100 примеров, из них 10 косячных - значит аккураси 0.90. Но проблема в том, что у любой модели есть как минимум несколько свойств, со своими метриками, а не зная какую конкретно бизнес задачу ты решаешь, непонятно какое из них ключевое. И вот ученые мужи, составители учебников заказывают рукава (или скорее хмурят высокие лбы) и пытаться собрать из вороха метрик и общих соображений синтетическую «хорошесть»: f1, например, который по сути гармоническое среднее между вполне физичными precision и recall. Вот почему тут гармоническое среднее, а не любая другая функция? Почему в dcg и ndcg экспоненциальное убывание полезности? Честный ответ:«потому» (вам могут соврать, придумав правдоподобное умное объяснение, но пожалуйста не ведитесь). Потому что по таким метрикам «в среднем паршивая модель» будет хуже, чем «в среднем хорошая».

Но нафига это тащить в бизнес кейс, где ты точно знаешь какую ценность ты хочешь получить и измерить? Бери и строй себе прокси метрики к твоим целевым, можешь даже тервер вспомнить, чтоб поточнее вышло. Ладно еще по метрикам из учебников сравнивают модели и выбирают субоптимальную, так еще и цели по ним начинают ставить - тогда вообще караул.

Очень я не люблю, когда люди не понимают физику процесса, за который берутся. В анекдоте про математиков и физиков в поезде я безусловно на стороне физиков: счетоводы прячутся от жизни в туалетах, а физики в итоге выходят раз-на-раз с кондуктором. Выбираем жизнь, а не симулякры!
  • 👍 10
  • ❤ 9
More from @artemonml
  1. Sep 28, 2026Появилось немного времени и наконец погрузился в вопросы агентизации SDLC. У нас в Т есть…
  2. Sep 23, 2026Очень смущают регулярные статьи вида «опенсорс всего на пол шага отстают от проприетарных…
  3. Sep 21, 2026Я сначала кринжевал с Барсика, купившего автомобиль в тбанке, а потом осознал весь постмод…
  4. Sep 19, 2026А зачем вообще вести тг канал? Иногда меня про это спрашивают знакомые, но чаще я сам зада…
  5. Sep 16, 2026Попугая научили говорить «эскалация» и он стал senior engineering manager’ом Какое-то врем…
  6. Sep 12, 2026Я думал, что буду писать «обо всём», но оказалось, что глубоко занимают меня на деле тольк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →