очень крутой доклад, вот короткое саммори:
/ путь к сильному ИИ(AGI) лежит через reinforcement learning (RL), а не через неэкспериенциальные подходы вроде LLM. главная проблема — недостаточно хорошие алгоритмы обучения.
/ что на самом деле является основным батлнеком алгоритмы обучения работают плохо, чтобы научить модель новому навыку, нужны тысячи часов обучения, и очень много данных
дальше предлагант новый подход к построению алгоритмов OaK — comes from Options and Knowledge
/ архитектура не должна содержать специфических знаний о мире, быть максимально универсальной
/ агент должен учиться только из опыта в реальном времени, а не из специальной обучающей выборки
/ агент должен уметь создавать новые абстракции и концепции по мере необходимости, ограниченный только вычислительными ресурсами
/ концепция “Big World Hypothesis”. мир гораздо сложнее и больше, чем любой агент. агент не может знать всё заранее, поэтому обучение и планирование должны происходить в runtime.
ну и дальше много говорит про архитектурные элементы OaK, это супер интересно, особенно про формирование представления о текущем состоянии на основе сенсорных данных, но лучше сами зацените, тут таймкод.
=====
еще тут оставлю несколько пейперов по теме, вернусь к ним позже, так как я очарован идеями выше 😏
Reward is Enough — https://arxiv.org/abs/2107.12979
Settling the Reward Hypothesis — https://arxiv.org/abs/1908.06976
Post #867
589
Forwarded from ASPI
YouTube Rich Sutton, The OaK Architecture: A Vision of SuperIntelligence from Experience - RLC 2025 As AI has become a huge industry, to a large extent it has lost its way. What is needed to get us back on track to true intelligence? We need agents that learn continually. We need world models and planning. We need knowledge that is high-level and learnable.…- ❤ 5