Reinforcement Learning from Passive Data via Latent Intentions [2023] - учимся жить, смотря ютуб
Сегодня у нас будет расслабляющий обзор статьи без глубоких философских рассуждений, как в старые времена.
Ютуб такой огромный и разнообразный, в нём столько данных, что придумывать разные способы извлекать знания из него можно бесконечно. Я уже писал ранее про то, как он был использован для предобучения агента игре в майнкрафт. А какие есть более общие подходы?
Если формализовать данные с ютуба, у нас есть только цепочки траекторий состояний в каких-то средах, т.е. кадры из видео, неизвестные награды и неизвестные совершённые действия. Нужен способ как-то обрабатывать именно такой вид данных.
Авторы этой работы делают смелое предположение: состояния S', встретившиеся после состояния S, с большей вероятностью можно считать целью агента в момент этой траектории, чем прочие состояния.
Основываясь на этом предположении, мы учим специальную функцию под названием Intent-Conditioned Value Function, которая показывает, насколько вероятно агент достигнет состояния S2 при нахождении в состоянии S1 и имея какую-то цель Z. Более подробно можно посмотреть в этом обзоре.
Пока всё это применяется на конкретном домене, т.е. модель учится на видеоиграх, например, Atari, и потом играет в них сама. По словам авторов, это работает лучше, чем бейзлайны, которые используют другую параметризацию и функции для обучения. Посмотрим, куда нас приведут подобные алгоритмы пассивного обучения.
@knowledge_accumulator
Post #91
1.72K

- 👍 14
- 🤔 2