Институт Аллена (Ai2) выпустил MolmoMotion - модель, которая предсказывает, как отмеченный в кадре объект будет двигаться в ближайшие секунды.
На вход подаётся кадр или короткая видеоистория, на видимом в сцене предмете отмечаются опорные точки, и добавляется текстовая инструкция (например, "подвинь и поверни деревянную миску с фруктами").
На выходе модель строит траекторию этих точек в трёхмерном пространстве, в метрах относительно камеры.
Под капотом - модель Molmo 2 на 4 млрд параметров. Институт обучил 2 версии:
🟢Авторегрессионный вариант, который достраивает траекторию по шагам;
🟠Версию на основе flow-matching для случаев, когда у действия есть несколько вероятных продолжений.
🟡В открытый релиз вошли только 2 AR-чекпойнта
🟢H3-F30 для типичного видео: 3 кадра истории и прогноз примерно на 2 секунды при 15 FPS;
🟢H1-F32 - когда доступен лишь один кадр.
🟡Помимо моделей опубликованы датасет и бенчмарк
MolmoMotion-1M - набор из 1,16 млн видео, который охватывает 736 типов движения и около 5,6 тыс. объектов.
PointMotionBench состоит из 2,7 тыс. размеченных людьми видеоклипов из сетов DAVIS, HOT3D и WorldTrack.
По замерам Ai2, на этом бенче MolmoMotion точнее всех методов, с которыми его сравнивали, включая генераторы видео и более простые базовые модели.
В симуляции система управления на базе MolmoMotion успешно выполняла 76,3% операций "взять и переставить" против 56,0% у аналога на Molmo 2, а при генерации видео модель улучшила движение по всем пяти измеряемым показателям.
Среди ограничений авторы называют использование лишь 8 точек на объект при обучении. Этого достаточно для общей траектории, но мало для точного описания сложных деформаций.
📌Лицензирование: Apache 2.0 License
🟡Блогпост
🟡Релиз на HuggingFace
🟡Техотчёт
🖥Github
@ai_machinelearning_big_data
#AI #ML # #MolmoMotion #Ai2