TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.68K subscribers
Post #182 2.67K
Если вам постоянно страшно от того, что вы упускаете какую-то возможность, то вы абсолютно правы

Многие слышали про такой термин, как FOMO (Fear Of Missing Out) - страх упущенной выгоды/возможности. Кто-то говорит, что он иррационален и нужно эти мысли просто отбрасывать. Я предлагаю сегодня разобраться в том, так ли это, с помощью RL.

Наша жизнь - это движение по пространству состояний мира S. У любого состояния s существует оценка того, насколько оно "хорошее": V(s). Это величина, которая показывает, какую суммарную награду вы получите, стартуя из данного состояния и действуя всё последующее время своей стратегией. Есть аналогичное определение Q(s,a) - такая же оценка состояния, но уже при условии того, что вы сейчас совершите действие a.

У вас есть ваша стратегия p(a | s), которой вы придерживаетесь. Легко показать, что V(s) = E_p(a|s) [Q(s, a)]. Теперь давайте посмотрим на конкретный момент времени и состояние s. Существует какое-то распределение на действия p'(a|s), максимизирующее E_p'(a|s) [Q(s, a)]. Это оптимальное распределение с вашей точки зрения, и наверняка ваше текущее распределение с ним не совпадает. В отличие от пошаговых игр, отсутствие действия это тоже одно из возможных действий. Таким образом, каждый миг то, что вы делаете, скорее всего, приносит вам упущенную выгоду.

Всё становится ещё более пугающим, когда мы обращаем внимание на оптимальную стратегию - p*(a|s). Это стратегия, идеально максимизирующая суммарную награду. Такая стратегия точно существует.

Для неё тоже есть оценка состояния и оценка действия в состоянии - V*(s) и Q*(s, a). Их можно использовать как "потенциал" агента - то, какой существует теоретический потолок суммарной награды. То, что можно достичь, принимая оптимальные решения.

Для них выполняется правило: V*(s) = E_p*(a|s) Q*(s, a). Это соотношение показывает потенциал до и после выбора действия в каждый момент времени. Если вы придерживаетесь стратегии p*(a|s), то ваш потенциал не уменьшится. В большинстве случаев ваш выбор ведёт к уменьшению потенциала. Если предположить, что вся награда подсчитывается в конце жизни, то мат. ожидание V*(s) в следующую секунду будет почти гарантированно ниже, чем в предыдущую.

Проще говоря - что бы вы ни делали, вы в самом лучшем случае будете не терять свой потенциал. С огромной вероятностью каждое ваше действие уменьшает его. Он непрерывно утекает у вас сквозь пальцы. Вы не можете это обернуть, только остановить, и то только в теории. В конце жизни гарантированно окажется, что из-за накопленных ошибок вы достигли только крошечную долю того, что могли бы.

Вы спросите - и что мне с этим делать? Отвечаю - забейте 👍

@knowledge_accumulator
  • 👍 38
  • 🗿 10
  • 🔥 5
  • ❤ 2
  • 🤔 1
  • 💩 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →