TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10493 26.5K
🌟 General Intuition в коллабе с Epic Games сделали мультиплеерную модель мира

Институт General Intuition вместе с французской лабораторией Kyutai и Epic Games представил MIRA, генеративный симулятор, воспроизводящий матчи Rocket League в формате 2 на 2 в реальном времени.

На входе только история кадров и нажатия клавиш всех четырёх игроков: ни физического движка, ни рендер-движка, ни явных 3D-представлений в инференсе нет.

В отличие от Odyssey, где логика вычислений и рендеринг разведены, MIRA пошла по пути генеративной симуляции в латентном пространстве видео.


В основе - диффузионный трансформер на 5 млрд параметров и отдельный видеокодек-представление на 600 млн.

Вместо автоэнкодера кодек строится поверх замороженного DINOv3-L, и латентное пространство выходит настолько стабильным, что специальные приёмы против дрейфа не понадобились, модель работает из коробки на обычном diffusion forcing.

Экраны четырёх игроков MIRA сшивает в единую сетку латентов, чтобы механизмы пространственного внимания работали между ракурсами и держали машины, мяч и события согласованными на всех видах.

Механизм action dropout достраивает поведение машин, для которых команды не пришли, компенсируя пропуски в потоках действий.

Всего на обучение MIRA ушло около 10 тыс часов геймплея, целиком сгенерированных ботами.


🟡 Тесты

Латентный подход бьёт пиксельный на порядок: gFID 10.7 против 81–105 и ARR 0.91 против 0.49–0.61 (ARR измеряет, насколько отданные команды считываются обратно из генерации).

Ключ к стабильности именно в DINOv3-L, без него картинка дрейфует в 1.3–1.7 раза сильнее, а с ним gFID держится ровным вплоть до 5 минут, и на практике роллаут идёт часами без коллапса.

ARR, кстати, совпадает с оценками живых людей (корреляция Пирсона 0.84).


🟡Недостатки

Контекст модели около четырёх секунд, поэтому повторы голов она попросту досочиняет - выглядит правдоподобно, но не совпадает с тем, что было на самом деле.

Часы и счёт плывут на переходах, а за 40 минут игры набегает порядка 80 некомандных бустов и 30 прыжков.


Авторы опубликовали код обучения и инференса, а также сет Rocket Science из 1000 часов каток в 720p с потоками действий и физическими состояниями.

На одной NVIDIA B200 модель выдаёт 20 FPS при 576p в реальном времени. Потыкать в играбельное демо можно тут.


@ai_machinelearning_big_data

#news #ai #ml
  • 👍 74
  • 🔥 36
  • ❤ 16
  • 👏 7
  • 🤷 6
  • 😁 5
  • 🤔 4
  • 😎 3
  • 💯 1
  • 🍓 1
More from @ai_machinelearning_big_data
  1. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
  2. Oct 2, 2026✔️ OpenAI заблокировала атаку дистилляции скрытых CoT своих моделей Компания пресекла камп…
  3. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  4. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
  5. Oct 2, 2026✔️ Anthropic раздаёт бесплатные плюшевые игрушки и стикеры На сайте для разработчиков clau…
  6. Oct 2, 2026🌟 SGLang научил чат-модели отвечать вероятностями Команда открытого движка инференса SGLa…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →