Новая жизнь испанского кота [2023]
Сегодня мы поговорим о статье от Deepmind про алгоритм RoboCat - потомок алгоритма Gato (исп. кот), про него я уже говорил ранее. Система Robocat учится решать большое количество разных задач, связанных с манипуляциями объектами.
Как и в Gato, мы всё ещё тренируем трансформер на последовательностях токенов. В них содержатся токены действий, токены-эмбеддинги показателей датчиков, токенизированная картинка, которую видит робот, а также токенизированная "картинка-цель", задающая цель задачи.
Способ обучения - всё ещё просто предсказание следующего токена действия по всем предыдущим токенам. В этот раз ещё добавляется предсказание нескольких следующих токенов изображений, которые будет видеть робот.
Ключевое отличие работы от предка - теперь датасет для претрейна формируется в том числе с помощью самой модели итеративно:
1) Сначала мы претрейним модель на большом датасете с траекториями, как и Gato
2) На каких-нибудь новых задачах собираем датасет с "экспертными" траекториями
3) Файнтюним на нём модель, опять же, предсказывая токены
4) Итоговой моделью генерируем ещё больше траекторий на этой новой задаче
5) Все эти траектории добавляем в датасет для претрейна
В итоге мы получаем новый претрейн, на котором можно повторить весь процесс, в том числе заново обучить картиночный токенизатор.
Крайне сложно сделать вывод о влиянии тех или иных изменений на итоговый результат, потому что изменений в деталях слишком много. Научной пользы из этой статьи можно извлечь не очень много, но сам результат, как инженерный и "продуктовый", достаточно интересный.
@knowledge_accumulator
Post #74
1.73K

- 👍 12