TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #79 204
Craftax: A Lightning-Fast Benchmark for Open-Ended Reinforcement Learning


Ранее мы уже писали о проблеме сбора данных для обучения рл агентов - регулярный переход с цпу на гпу сильно снижает скорость сбора и качество данных и все такое

В последнее время в области рл произошел бум в связи с jax'ом, который позволяет не только производить компиляцию всего процесса обучения (Just-In-Time Compilation), но и в невероятно огромных масштабах параллелизовать процесс сбора траекторий в средах, не переходя обратно на цпу. Этот феномен имеет название JAX-based environments phenomenon

Насколько ускоряется этот процесс? Например, если вы возьмете готовый скрипт PPO из популярной репы cleanrl, то процесс обучения займет несколько часов на нескольких миллионах апдейт шагов

Авторы этой статьи способны обучить на своей среде PPO на миллиард шагов меньше чем за час и достигнуть 90% от оптимального уровня - вот один из плюсов джакса👡

(!) Но это еще не все - поскольку идет такое невероятное ускорение в сотни раз (буквально), то это позволяет и обучать агентов гораздо быстрее => ресерчерам проверять быстрее гипотезы => получать сота результаты по старым средам быстрее => усложнять среды, чтобы двигать область вперед

Крафтакс - оч яркий пример таких джакс сред, который в себя включает достаточную сложность и вопросы бесконечного эксплорейшна, долгосрочного планирования, адаптации к новым уровням и модельной памяти (это буквально инди игра), где можно очень сочно и быстро развивать существующие методы, чтобы рл перестала быть как область топорной непонятной штукой во многих местах и начала пробивать все потолки


👀LINK

#rl #jax #openendedness #compute #exploration #planning #memory #adaptation
  • 🤯 1
  • 🤩 1
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →