TGViewer
rafanalytics rafanalytics @rafalytics · 5.66K subscribers
Post #217 4.56K
Самый жизненный раздел из ML 😱

Вы наверняка видели видосы, где ИИ обучают играть в разные игры: к примеру тут Open AI ещё до появления ChatGPT выпускал довольно хайповый видос про обучения ботов игре в прятки. Подобные идеи относятся к теме Reinforcment Learning (или RL), которую я, почему-то, в университете так и не изучал, хотя вроде брал разные курсы на тему ML 🤔

Но так уж вышло, что недавно преподавание заставило меня разобраться в этой теме подробнее, и больше всего мне понравилось, как идеи из ML можно переносить в целом на процессы в повседневной жизни. Вот две интересных для меня идеи:

1) Мы постоянно прогнозируем свой «профит» и часто завышаем его 🤫

В RL игрок не знает заранее, какой "профит" принесёт то или иное действие. Всё что у него есть — накопленный опыт, на основе которого он учится предсказывать "выгодность" каждого следующего шага. Для этого в RL вводят конкретную Q-функцию, которая оценивает суммарную ожидаемую награду за конкретное действие в конкретной ситуации.

Вот только есть один неприятный момент — так называемый "overestimation bias": это когда игрок склонен завышать свои ожидаемые награды, особенно когда данных ещё мало. Мы делаем то же самое: думаем, что новая работа окажется идеальной, а переезд сразу изменит жизнь к лучшему. Иногда так и выходит, но чаще реальная награда оказывается скромнее ожидаемой, да?))

2) Сначала исследование, а потом эксплуатация 🧑‍🎓

В RL есть два режима.
Во время обучения игрок специально исследует разные действия, даже если некоторые выглядят неоптимально — это так называемый "exploration". Только так можно найти по-настоящему лучшую стратегию. На инференсе же агент переключается в "exploitation": берёт лучшую из найденных стратегий и действует максимально эффективно.

Это хорошая метафора для жизненных этапов: пока есть "ресурс на ошибки" — можно быть в режиме exploration и пробовать разные сферы, роли, проекты (так скажем быть открытым к возможностям). Когда понял, что работает — переключаешься в exploitation.

Так что вывод простой:
Чтобы избежать overestimation bias — можно чуть занизить свои ожидания, а ещё убедиться, что собрал достаточно вводных данных перед тем, как переходить в режим exploitation. И это не всегда про машинное обучение))


Ставь ❤️ если нравятся посты такого формата, где идеи из DS перекладываются на рутину (таким образом я смогу скорректировать наиболее подходящие для блога форматы)
YouTube Multi-Agent Hide and Seek We’ve observed agents discovering progressively more complex tool use while playing a simple game of hide-and-seek. Through training in our new simulated hide-and-seek environment, agents build a series of six distinct strategies and counterstrategies, some…
  • ❤ 56
  • 🔥 12
  • 👍 11
  • ❤‍🔥 3
  • 🐳 1
  • 🌭 1
More from @rafalytics
  1. Sep 1, 2026Вдохновляющая статистика из тенниса 🎾 Есть вот такая статья про статистику Роджера Федере…
  2. Jul 14, 2026Как эффективнее попросить рефералку? 🤝 Мне часто пишут ребята из канала с просьбой пореко…
  3. Jul 7, 2026Анализируем водопой на ЧМ-2026 💧⚽️ Приятно, когда можно объединить аналитику с увлечениям…
  4. Jun 16, 2026Считаем крошки на рынке фастфуда Вчера я впервые попробовал "Крошку-Картошку") 🥔 Странно,…
  5. May 27, 2026Личный блог — это плюс в карьере или red flag для нанимающих? 🚩 Я начал вести этот канал…
  6. May 22, 2026Есть кто на Aha’26? Газ нетворкаться 😎 Если вы на конференции в Москве, то давайте спишем…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →