TGViewer
Модель предскажет Модель предскажет @modprod · 390 subscribers
Post #57 201
Один из самых недооценённых лайфхаков в ML — это правильные негативные примеры

Привет! На связи Мария Жарова, ментор курсов «ML-инженер» и «Дата-сайентист» 👋🏻

Когда люди начинают изучать ML, обычно всё выглядит довольно просто: есть объект и есть правильный ответ. В процессе обучения мы показываем модели много таких примеров, чтобы она сама научилась предсказывать.

Но в серьёзных ML-задачах этого часто недостаточно, потому что модели важно не только понимать, что является правильным, но и уметь отличать это от неправильного. Например:

➖ В рекомендациях нужно выбрать лучшие товары среди тысяч других и расположить их в правильном порядке;
➖ Аналогично в поиске — найти самые подходящие документы;
➖ В матчинг-задачах — отличать похожие объекты от непохожих;
➖ В CV и NLP — понимать, какие изображения или тексты действительно близки по смыслу, а какие нет.

И тут всегда возникает проблема: потенциально «неправильных» вариантов обычно слишком много.

Представьте рекомендательную систему: пользователь купил кроссовки — это позитивный пример. Но товаров в магазине могут быть миллионы.


В процессе обучения нельзя каждый раз сравнивать покупку вообще со всеми остальными товарами маркетплейса — это слишком дорого по памяти и вычислениям. Поэтому во время обучения обычно берут только часть негативных примеров — то есть специально выбирают, какие «неправильные» ответы показать модели.

Простейший вариант — взять негативы случайно, но в этом есть свои риски: например, пользователь купил кроссовки, а в негативы попал холодильник. Формально всё правильно — холодильник действительно не купили, но проблема в том, что такой «негатив» слишком простой.

Другими словами, модель быстро выучится, что «кроссовки ≠ холодильник» — и почти ничего полезного из этого не получит. Потому что реальные ошибки обычно происходят не между совершенно разными объектами, а между похожими: то есть не между кроссовками и холодильником, а между двумя похожими моделями кроссовок.

Поэтому в хороших production ML-системах негативы стараются делать более «сложными». Например, в негативы могут специально добавлять товары из той же категории, похожие фильмы, близкие тексты, объекты с похожими эмбеддингами или товары, на которые пользователь кликнул, но не купил.

Такие примеры заставляют модель учиться гораздо лучше, потому что ей приходится разбираться в мелких различиях, а не в очевидных. И очень часто качество негативных примеров влияет на итоговый результат сильнее, чем очередная сложная архитектура или тюнинг гиперпараметров.

Поэтому две команды могут использовать одну и ту же модель, но получать совершенно разное качество 🙂

Сохраняйте, чтобы не потерять ❤️
  • 👍 7
  • ❤ 4
  • 🔥 4
More from @modprod
  1. Sep 7, 2026🔥 Новый поток интенсива по ML 9-16 сентября пройдёт следующий поток ML-интенсива с ментор…
  2. Sep 1, 2026Между тем, как выглядит ML в курсах и соревнованиях, и тем, как он устроен в реальной повс…
  3. Aug 20, 2026Модель уже начала деградировать. Просто вы об этом ещё не знаете Привет! На связи Мария Жа…
  4. Aug 12, 2026🔥 Ваш шанс получить крепкую базу в data science Привет! На связи Мария Жарова, ментор кур…
  5. Aug 11, 2026Батч или real-time: выбор, который делают до того, как обучили модель Привет! На связи Мар…
  6. Aug 9, 2026Всем привет! Я Валерия Елпатьевская, инженер данных в Альфа Банке и ментор Симулейтив 👋🏻…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →