TGViewer
Убежище аналитика Убежище аналитика @shelter_analytics · 1.14K subscribers
Post #31 2.22K
Всем привет!😊

Вчера мне в Линкедине попался пост ДС-ера, который рассказывал про особенности метрики качества регрессии: MAPE — Mean Absolute Percentage Error.

❓ Почему вообще мой взгляд остановился на этой записи?
А потому что в моей работе, да и в целом в исследованиях в Авито у аналитиков любого уровня я вижу, что постоянно в качестве качества модели регрессии предъявляется MAPE, что логично, потому что бизнесу ну очень легко проинтерпретировать результаты, но оказалось, что за этой простенькой и безобидной формулой скрывается важные нюансы, которые в своих исследованиях отдельно никто не проговаривает, а они очень сильно влияют на значение MAPE.

Каюсь, я тоже не задумывался об этом и только вчерашний пост сподвиг на размышления.

❗️Итак, есть 2 нюанса в MAPE, которые стоит учитывать:

1️⃣ Если у вас y_true, т.е. истинные значения маленькие (математик скажет - стремятся к нулю), то ваш MAPE будет сильно раздут (устремится в бесконечность), потому что в формуле используется деление на маленькое число (из школы мы знаем, что делить на 0 нельзя).
2️⃣ Наверное самое важное: сама формула MAPE несимметрична. Это значит, что одинаковая абсолютная ошибка будет иметь разные относительные проценты в зависимости - недооценивает наша модель или переоценивает.

Приведу пример:

Предположим, что y_true у нас 10, а y_pred = 20, тогда MAPE = 100% (|(10 - 20) / 10|). (модель переоценивает)
Рассмотрим симметричный случай, т.е. y_true у нас 20, а y_pred = 10, тогда MAPE = 50% (|(10 - 20) / 20|). (модель недооценивает)

Вуаля, вы можете заметить, что одна и та же ошибка 10 "попугаев" идёт в формулу MAPE по разному с относительной точки зрения - 100% и 50% (разница заметная).

❓Как быть?

С первым пунктом понятно - стараться избегать применения относительных формул для данных, где есть маленькие значения, либо добавлять небольшое число (эпсилон) в знаменатель.

А со вторым пунктом ситуация интереснее:

⚠️ Умные ДСеры задумывались над проблемой ассиметричности и придумали метрику, которая решает эту проблему: SMAPE — Symmetric MAPE, но внимательный читатель может заметить, что в знаменателе у данной формулы всё-таки стоят другие значения. Можно ли вообще говорить что 20% MAPE сопоставимы с 20% SMAPE, т.е. под собой они имеют одинаковую интерпретацию. Оказывается, что такое можно сказать, так как SMAPE очень хорошо моделирует MAPE. Пост в медиум.

📈 Если вдруг вы всё-таки хотите использовать MAPE, то нужно тогда проверять корректность значения, что маленькое MAPE не является следствием того, что ваша модель недопредсказывает значение истинное постоянно, но при этом ошибка абсолютная неприемлема для вывода о том, что модель качественная.

Всем продуктивного дня!👨‍💻
  • ❤ 13
  • 🤔 3
  • ⚡ 2
More from @shelter_analytics
  1. Sep 8, 2026Post #80
  2. Sep 4, 2026Post #79
  3. Sep 4, 2026Post #78
  4. Aug 17, 2026Post #77
  5. Aug 9, 2026Post #76
  6. Jun 9, 2026🚨🚨🚨AI в Causal Inference - это хайп или полезный инструмент? Всем привет!🤟 Сегодня нат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →