TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.68K subscribers
Post #208 2.55K
Generalization to New Sequential Decision Making Tasks with In-Context Learning [2023]

Продолжаем разбираться в In-Context лоре. Играться с In-Context трансформерами (ICT) можно разными способами. Мы уже разбирали два из них:

1) Cценарий Gato, когда на вход подаётся траектория в рамках одного эпизода в среде, и модель учат предсказывать действие эксперта в данном контексте.
2) Cценарий Algorithm Distillation / AdA, в котором алгоритм получает на вход не одну траекторию, а всю историю взаимодействия алгоритма со средой, и учится либо предсказывать действие алгоритма, либо на награду с помощью RL в квадрате.

Авторы данной работы хотят получить ICT, быстро адаптирующийся к новой задаче, но облегчают проблему, допуская, что у нас есть несколько экспертных траекторий в данной среде. Это близко к in-context решению задач, которое мы проворачиваем с LLM, когда добавляем в контекст несколько примеров правильных пар вход-выход, можно даже сказать, что близко к сценарию ARC.

При этом, авторы говорят о сильной out-of-distribution генерализации, т.е. тестированию алгоритма на средах, совсем непохожих на обучающие. В общем, цели я одобряю. В чём заключается подход авторов?

На вход трансформеру подаётся текущая траектория агента в среде - состояния, действия, награды. Помимо этого, туда подаются несколько экспертных траекторий из этой же среды. В отличие от Algorithm Distillation / AdA, это не история обучения алгоритма на данной задаче. Это просто засэмплированные из датасета траектории уже обученного PPO, применённого на этой задаче.

В рамках сред существуют "уровни" - конкретные расположения всех объектов. Авторы всегда помещают как минимум одну экспертную траекторию из того же самого уровня, на котором идёт тестирование, в контекст. Учитывая, что среды сами по себе детерминированные (за исключением случайного залипания действия), это довольно сильная подсказка.

На то, что задача не очень сложная, наводит наличие такого бейзлайна, как Hashmap. Судя по описанию, авторы создают простой маппинг из состояния в действие на основе экспертных траекторий из контекста и пытаются играть им. Такая схема будет выдавать нулевой результат в любой неигрушечной задаче, но здесь они его используют.

Другой бейзлайн - это чистый Gato, но они его называют Behavioural Cloning. К сожалению, среди бейзлайна нет самого эксперта (PPO), не считая его калеку-представителя в виде Hashmap.

В результате, ICT с экспертными траекториями в контексте побеждает и Gato, и Hashmap, при этом сам Gato больше, чем на половине графиков, проигрывает Hashmap. Получается, что ICT получилось обобщить за пределы задач, на которых его обучали, но все они были настолько простыми, что особо порадоваться я не могу. При этом, нельзя сказать, что авторы придумали что-то сильно новое и чего-то качественно добились. Их подход вряд ли позволяет получить обобщающийся ICT с большей вероятностью, чем Algorithm Distillation / AdA.

@knowledge_accumulator
  • 👍 10
  • ❤‍🔥 1
  • ❤ 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →