TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #84 1.68K
Evolving Reinforcement Learning Algorithms [2021] - учим оптимальный RL-апдейт весов

После изучения предыдущей работы и осознания потенциала end-to-end обучения всего алгоритма целиком начинают очень сильно бросаться в глаза проблемы случаев, когда это делают не так.

Современные RL-алгоритмы это конструкции из большого количества костылей, подобранных человеком вручную для улучшения производительности. Но кое-что в них представляет собой то, что можно оптимизировать оптимизацией программы - это функция ошибки.

Традиционная DQN-ошибка:
L = (Q(s_t, a_t) − (r_t + γ ∗ max_a Q_t(s_{t+1}, a)))^2
имеет теоретические обоснование, но встречается с огромными проблемами на практике.

Поэтому авторы решают представить ошибку в виде вычислительного графа (см. картинку) и оптимизировать её вычисление эволюционным алгоритмом. Мутации - это просто добавление / изменение рандомной вершины этого графа. Качество замеряют, обучая алгоритм с этой ошибкой.

На мой взгляд, проблемами такой параметризации является то, что в ней огромное количество функций это полный мусор, и то, что возможность локального подъёма к оптимальной функции в ней неясна. Их наличие подтверждается тем, что результат сильно лучше, если добавлять в популяцию уже существующие алгоритмы.

Тем не менее, в результате у них получаются довольно странные функции, которые работают лучше бейзлайна. Кожаные мешки в статье пытаются интерпретировать их, но они ещё не поняли, что пути оптимального алгоритма неисповедимы.

Всё это подтверждает 2 вещи, в которые я верю:
1) У человека явно есть сложности с тем, как применять RL-методы на реальных задачах
2) Мы получим алгоритм другого уровня, когда сможем оптимизировать весь RL-алгоритм, а не его кусочек

@knowledge_accumulator
  • 👍 5
  • 🤔 3
  • 🔥 2
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →