🔥GATO: новая SOTA от DeepMind
19 мая 2022 года исследователи DeepMind опубликовали статью о новом едином универсальном агенте за пределами области текстовых выходов. GATO работает как мульти-модальная, многозадачная, многовариантная универсальная политика. В одной и той же сети с теми же весами можно играть в Atari, записывать изображения, общаться в чате, манипулировать блоками и решать другие задачи на основе своего контекста: генерировать текст, определять оптимальные крутящие моменты в суставах, события нажатия кнопок и пр.
GATO обучается на большом количестве наборов данных, включающих опыт агентов как в смоделированных, так и в реальных средах, в дополнение к множеству наборов данных на естественном языке и изображениях. На этапе обучения GATO данные из различных задач и модальностей сериализуются в плоскую последовательность токенов, группируются и обрабатываются нейросетью-трансформером, аналогичной большой языковой модели. Потери маскируются, поэтому GATO предсказывает только действия и текстовые цели.
При развертывании Gato токенизируется подсказка-демонстрация, образуя начальную последовательность. Затем среда выдает первое наблюдение, которое также токенизируется и добавляется к последовательности. GATO авторегрессивно выбирает вектор действия, по одному токену за раз. После того, как все маркеры, составляющие вектор действия, выбраны (определены спецификацией действия среды), действие декодируется и отправляется в среду, которая выполняет шаги и дает новое наблюдение. Затем процедура повторяется. Модель всегда видит все предыдущие наблюдения и действия в своем контекстном окне из 1024 токенов.
https://www.deepmind.com/publications/a-generalist-agent
Post #273
977