TGViewer
Тестирование и оценка ИИ Тестирование и оценка ИИ @testingofai · 1.37K subscribers
Post #35 695
Сегодня разберем метрики регрессии для ML моделей, а именно как правильно оценивать качество предсказания непрерывных значений, например, цены, температура, продажи в моделях машинного обучения.

RMSE (Root Mean Square Error):
Показывает среднеквадратичную ошибку модели. Ключевая особенность, она возводит ошибки в квадрат, поэтому большие ошибки в предсказаниях "штрафуются" сильнее маленьких.

Пример: предсказываем время доставки. Четыре заказа с ошибкой по 2 минуты, один с ошибкой 20 минут. RMSE = 9.1 минуты. Один выброс "испортил" всю оценку, хотя 80% предсказаний точные.

MAE (Mean Absolute Error):
Берет среднее от всех ошибок по модулю. В том же примере MAE = 5.6 минуты, что честнее отражает реальность.

MAE устойчив к выбросам, легко интерпретируется и не штрафует большие ошибки. Но когда большие разборы критичны для работы модели, то используем оценку RMSE.

R² (Coefficient of Determination):
Показывает, какую долю изменений в данных объясняет модель.

Пример с ценами домов: дома стоят 300K, 450K, 700K. Если модель всегда предсказывает среднюю цену 483K, то ошибки получаются огромные (например, 483K и 700к).

Умная модель учитывает, например, площадь, район, год постройки и предсказывает уже $320K, $470K, $680K и ошибок тут уже намного меньше. R² = 0.75 означает "наша модель объясняет 75% различий в ценах домов" определенными параметрами.


Quantile Regression:
Вместо "доставка займет 30 минут" дает "с 90% вероятностью от 20 до 45 минут". Критически важно для медицины, финансов, автопилотов — везде, где нужны гарантии.

Как выбрать:
RMSE - когда большие ошибки в предсказаниях критичны
MAE - когда есть выбросы, но все ошибки равноважны
R² - для сравнения моделей, обученных по разным технологиям
Quantile - когда нужно понимать, в каком диапазоне неопределенности работает модель

Важно понимать, что каждая метрик освещает разные аспекты модели и помогает принимать решения о качестве предсказаний.


Полезная информация:
Курс по evaluation AI |
С чего начать изучение AI | Инструменты для оценки AI
  • 👍 3
  • 🔥 1
More from @testingofai
  1. Sep 23, 2026Сейчас поднялся новый хайп вокруг модели JEV от TypeSafeAI, ну и я конечно же сразу стал р…
  2. Sep 22, 2026С чего начать оценку ИИ агента, если у вас сейчас есть только прототип вашего ИИ агента. П…
  3. Sep 17, 2026Сегодня хочу поговорить про оценку голосовых AI агентов, потому что иногда вижу, что коман…
  4. Sep 15, 2026Недавно наткнулся на разбор того, как одна команда переводила ИИ агента с Claude Opus на G…
  5. Sep 10, 2026Сегодня поговорим про ситуацию, с которой сталкивается почти каждый, кто начинает оцениват…
  6. Sep 2, 2026Обычно, чтобы оценить работу ИИ агента, нам нужны тест-кейсы, или по другому датасет оценк…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →