TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #872 2.32K
Новый крутой пейпер про дистилляцию RL-алгоритмов от DeepMind. Их Algorithm Distillation позволяет модели во время инференса улучшать свою стратегию решения, самостоятельно исследовать окружающий мир, и это без промтинга и без файнтюна под конкретную задачу. И в целом генерализация гораздо выше, чем у предыдущих методов

Попыток скрестить RL и трансформеры уже было достаточно (например, Gato и Decision Transformer), но это не RL в полном смысле слова. Такие модели могут предсказывать следующее действие актора, но для этого им нужен промт с предыдущими состояниями, действиями и reward’ами, сами они не могут в explore and exploit, а также они не могут самостоятельно на инференсе обучиться под новые задачи. Также они учатся сразу на лучшей стратегии, поэтому не могут ее сами итеративно улучшать

Для обучения Algorithm Distillation брали learning histories RL-алгоритмов (например, DQN) на отдельных задачах. При чем, историю делали достаточно длинной, чтобы в нее попадало несколько эпизодов, и можно было пронаблюдать, как улучшается стратагия –> благодаря этому, AD учится не только предсказывать текущую стратегию, но и сразу улучшенную. Что прикольно, в некоторых задачах был еще и partial observation, то есть когда передается не все состояние игры, а только какая-то его часть, известная игроку

На инференсе AD находит лучшую стратегию даже быстрее, чем исходные алгоритмы, которые были дистилированны (! хотя не побивает их перфоманс в целом), сам исследует пространство и сам генерирует себе контекст. Способность исследовать, кстати, оценивали на задаче Dark Room, где большая часть действий и состояний дают reward = 0, то есть без исследования решить ее не получится

📝 Тред от одного из авторов про модель
  • 👍 5
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →