Is Value Functions Estimation with Classification Plug-and-play for Offline Reinforcement Learning?
недавно вышла статья от дипмаинд, которая меняет парадигму обучения Q функций в рл - вместо того, чтобы регрессией ее фиттить под уравнение Беллмана, лучший результат получается, если аутпут критика разделить на бины и обучать его посредством классификации
а авторы этой статьи решили проверить, а насколько это верно в оффлайн сеттинге на д4рл - для оффлайн алгоритмов внедрить такую классификацию? (проверяли ReBRAC IQL LB-SAC ) а обучать при помощи HL гаусса
что получилось?
- лучше перформанс по сравнению с сота решениями
- в важных местах стабилизировался результат (на том же AntMaze критик ребрака перестал расходиться, в то же время на маленьких датасетах оверфит на адроите)
- лб сак стал хуже на горизонте всех тасок, как и iql (с лб саком может быть связано из-за размера ансамбля)
- нету масштабирования для МЛП, хотя в изначальной папире можно масштабировать резнет и трансформер (скорее всего просто проблема млп)
куча табличек с расчетами (которые получились не без помощи джакса), которые не дают практически поводов сомневаться в эмпирических выводах авторов + чистый код. (и даже есть EOP для гиперов)
Явного ответа нет, присутствует ли улучшение - в этом и ресерч, панацея редко когда придумывается
один из примеров того, как следует писать текст, проводить эксперименты и репортить результаты из них + предоставлять воспроизводимый и понятный код
👀LINK
Post #243
402


- 🔥 3
- ❤ 1