Архитектура трансформера показала свою высокую результативность на большом классе задач, начиная от моделирования естественного языка и заканчивая обработкой изображений. Во многом, хорошая применимость данной архитектуры обусловлена тем, что подходы Supervised Learning и Self-Supervised Learning на заранее подготовленных данных являются достаточно стабильными, хорошо изученными и имеют уже проверенные техники, обеспечивающие качественное обучение.
В свою очередь, обучение трансформера в Online RL хоть и позволяет применять эти модели в задачах с частичной наблюдаемостью или дефицитом оффлайн данных, однако является нестабильным и медленным. Попытки преодоления этих трудностей во многом сводятся либо к переходу в оффлайн режим (Decision Transformer), либо к
к смешиванию оффлайн и онлайн обучения (Online Decision Transformer). Хотя эти методы и обеспечивают искомую стабилизацию и повышение производительности, они также обременены важным прикладным ограничением в виде необходимого набора экспертных тректорий.
На данном семинаре аспирантом нашего Центра будет рассмотрена работа Accelerating Transformers in Online RL, в которой предложен метод обучения трансформера, сочетающий в себе как Behavior Clonning (BC) на данных эксперта, так и обновление по Online RL loss-функции.
Данный двухэтапный Teacher-Student алгоритм разгоняет трансформера на экспертных данных с помощью BC loss-функции в рамках первого этапа, а затем переходит к Online RL обучению на втором этапе. Не смотря на BC компоненту, алгоритм не требует заранее подготовленных данных эксперта, а использует траектории Акселератора в онлайн режиме, тем самым снимая важное ограничение методов, упомянутых выше.
👉🏻 Дата: 20.11.25, четверг в 17:00
📹 Трансляция: Youtube или ВК
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!
#RL #transformers
