In-Context Reinforcement Learning for Variable Action Spaces [2024]
Я уже упоминал Algorithm Distillation ранее - эта достаточно прорывная идея заключается в том, что мы можем дистиллировать алгоритм в нейросеть. Для этого нам необходимо сгенерировать алгоритмом датасет из "траекторий" обучения, а затем учить нейросеть предсказывать действия алгоритма при условии всей предыдущей истории.
В обозреваемой работе, которая ещё и по совместительству творчество подписчиков, делается шаг в сторону увеличения гибкости этого подхода. Вместо того, чтобы обучать классификатор действий с фиксированным количеством вариантов, мы делаем так:
1) Для каждого нового экземпляра среды, для каждого действия мы генерируем случайный эмбеддинг
2) При предсказании действия нейросеть выплёвывает вектор действия.
3) Мы обучаем этот вектор на contrastive loss - тот же softmax + logloss, но используем векторы из пункта №1 как "опорные" для каждого действия.
В итоге, что видит трансформер на входе:
- Список эмбеддингов всевозможных действий
- Траектория алгоритма - s_1, a_1, r_1, s_2, ..., s_n
Судя по результатам, улучшенный алгоритм обгоняет AD в случае перемешанных действий и умеет работать на средах с новым количеством действий.
Статья интересная и является движением в правильную сторону. В какой-то момент мы перестанем использовать трансформеры для ICL и, скорее всего, эта идея сможет быть переиспользована.
Algorithm Distillation, думаю, очень пригодится при мета-обучении AGI, поэтому рад, что люди работают над его развитием.
@knowledge_accumulator
Post #204
2.93K

- 👍 15
- 🔥 7
- ❤ 3