От генератора картинок до управления роботами
Вышла FLUX 3 Action от Black Forest Labs - 7B world-action модель (WAM) с открытыми весами в вариантах Base, Droid и Sol101 (последние две дообучены под определенные датасеты).
В свое время выход первой FLUX знаменовал архитектурный сдвиг от UNet к диффузным трансформерам в генерации изображений. Особый хайп был в том, что модели начали генерировать на картинках текст. Но это все еще были просто картинки.
Также отдельно появились Vision-Language-Action (VLA) модели. Они превращали кадры с камеры в текстовые псевдо-токены и использовали LLM для предсказания текста вместе с токенами действий. Языковые модели начали управлять роботами, кое как ориентируясь по изображениям.
В противовес LLM отдельным треком стали развиваться "модели мира" в стиле JEPA от Лекуна, суть которых была в предсказании латентных (скрытых) представлений изображений без их реконструкции на уровне пикселей.
WAM идет путем полного предсказания видеокадров и действий. Хоть такое предсказание и более ресурсоемкое, по качеству оно заметно превосходит VLA, а также опережает другие открытые модели на таких ведущих бенчмарках по управлению роботами, как RoboLab.
Попробовать такие модели на практике не столь просто - их нужно дообучать под конкретный контроллер. Но мы при случае обязательно попробуем!
Post #31
75