Towards General-Purpose In-Context Learning Agents
yet another paper on область, которую мало кто понимает, но гугл ?почему-то? делает патенты на ее счет. а именно статья про In-context Meta-Reinforcement Learning от пхд студента шмидхубера (и самого шмидхубера)
so, какие идеи новые они привнесли для расширения картины?
- по-другому собирают транзишны для подачи в трансформер
- обучают на оч разных тасках, я бы сказал гетерогенных (от картпола до муджоко)
- повышают вариативность и обобщающие способности путем рандомных проекций (которые для удобства еще и приведены к одному размеру по всем задачам), что уже делалось здесь
- + в задаче моделирования последовательности действий делают интервал между таймстепами для контекста, непосредственно та подпоследовательность, которая подается в трансформер, и таргет действиями. то есть авторы предсказывают не следующее действие относительно контекста (как классически делают next-token prediction в языковом моделировании) а с небольшим разрывом вправо, который тем не менее отвечает за более быструю сходимость трансформера как агента (главный контрибьюшн статьи имхо)
результаты норм, усреднены аж по 32 сидам по классическим средам. что ок
плохо только что кода нет и разъяснений по поводу того, как именно применяются рандомные линейные проекции на техническом уровне и как от них раскодировать аутпуты модели (которые приведены к одной размерности для удобства, но для разных тасок природа действий может быть совершенно разной)
👀LINK
Post #366
377




- 👍 2