Статья с демо, полным мемного потенциала – MotionGPT: Finetuned LLMs are General-Purpose Motion Generators
https://qiqiapink.github.io/MotionGPT/
Суть идеи: у нас есть 3D-модель человечка, которая совершает какие-то движения. Каждое движение мы можем прогнать через VAE-энкодер (предобученный) и получить какой-то токен, который будет означать текущую позу. Что-то типа ‘токен 259’ = ‘человек сидит с поднятыми руками и повернув голову’
Дальше мы берем языковую модель (тут LLaMA), подаем токен исходной позы и просим сгенерировать следующие motion tokens согласно описанию. Например, описание может быть ‘человечек скрючившись идет а потом прыгает’. Поскольку в датасете был ground truth (реальные последовательности движений, соответствующие описанию), то лосс просто кросс-энтропийный, ничего необычного. Тюнили кстати через LoRa всего 0.4% параметров
Дальше сгенерированные motion tokens разворачиваются обратно в позы через тот же VAE. Единственное заметное ограничение тут – поскольку все позы дискретные, то есть каждый токен означает какое-то конкретное движение из датасета, сложно как-то генерализоваться и совершать действия, которых в тренировочных данных не было
Post #962
3.58K
- 👍 11
- 🔥 2
- ❤ 1
- 🤔 1