TGViewer
ML for Value / Ваня Максимов ML for Value / Ваня Максимов @ml4value · 5.69K subscribers
Post #391 5.09K
Ошибки ML-валидации везде

Мы живем в интересном мире, где кучу топовых алгоритмов в рекомендациях, поиске и LLM неправильно валидируют

Казалось бы, что может быть проще метрики precision по топ-k рекомендациям (сокращенно precision@k)? Да на каждом курсе войти-в-ds этому учат!) Но нет, в мире рекомендаций все считают эту метрику по-разному. Целая статья на RecSys’21 про это вышла: табличка из нее прикреплена к посту

В мире LLM все еще хлеще. Обучение на тесте, на примерах из других моделей. ChatBot Arena тоже оверфитится prompt майнингом, разным подглядыванием в тест и опять же обучением на тестовых данных. Даже Андрей Карпатый уже бьет тревогу

В общем, если вы тоже сомневаетесь в оценке многих современных моделей - не сомневайтесь, она нечестная почти 💯

Эвалить риал-тайм системы особенно с feedback loop и правда нетривиальное дело. У меня есть вот такой список советов, как это сделать лучше:

- Подстройте train-val-test split под природу ваших данных: по времени, пользователям, стратифицированно или нет. Учтите лаг между трейном и инференсом
- Заведите себе базовый хорошо выверенный train-val-test датасет, на котором будете проверять все модели. Например, в поиске это может быть фиксированная «корзинка» частотных и важных запросов
- Потратьте время на поиск хорошей метрики. Чтобы она коррелировала с онлайн-прокси и с ключевыми бизнес-метриками. Это непросто. Придется периодически эту метрику улучшать: этого иногда требуют новые модели/подходы или новые бизнес-цели

Ну и еще сегодня день рождения Эйнштейна: пусть в AI и науке уже 21ого века будут более честные метрики и эксперименты 🧪
  • 👍 32
  • 🔥 11
  • ❤ 3
More from @ml4value
  1. Sep 17, 2026Post #496
  2. Sep 14, 2026ML вообще работает? (эпизод 1) Давно не писал в канал. Понял, что сейчас сфокусирован на д…
  3. Jun 12, 2026The art of a strong baseline За последнее время все чаще понимаю, что создать сильный бейз…
  4. May 2, 2026Начинать писать после перерыва всегда непросто, поэтому пока легкий пост про мои новости)…
  5. Mar 29, 2026LLM - велосипед в новой обертке Холиварный пост выходного дня) Доля правды в этом есть - и…
  6. Mar 27, 2026LLM долгосрочные интересы пользователя Понемногу LLM-ки находят полезное применение в реко…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →