TGViewer
Neurohive Neurohive @neurohive · 5.18K subscribers
Post #1965 6.5K
🎮 MIRA: нейросеть полностью симулирует Rocket League для четырёх игроков в 20 FPS, не требуя установки игры

General Intuition, Kyutai и Epic Games представили MIRA — мировую модель, которая полностью симулирует игровую среду Rocket League сразу для четырёх игроков и рисует каждому свою картинку в реальном времени.
Движка игры внутри нет вообще. Ни физического движка, который считает столкновения мяча и машин, ни рендерера, который рисует арену. Всё это заменяет одна нейросеть, которая по нажатиям кнопок сама дорисовывает следующий кадр. Игра целиком «живёт» внутри весов модели, поэтому запустить её можно локально, без установки оригинальной Rocket League.

Под капотом диффузионный трансформер на 5B параметров. Он предсказывает не пиксели напрямую, а сжатое скрытое представление кадра поверх замороженного экстрактора признаков DINOv3-L: кадры сначала сжимает видео-кодек, модель предсказывает следующий скрытый кадр, а декодер разворачивает его обратно в картинку. Работает в реальном времени: 20 FPS на одной Nvidia B200. Обучена на 10 000 часов матчей 2 на 2, полностью сыгранных ботами.

Четыре картинки согласованы благодаря тому, что ракурсы игроков складывают в одну сетку и предсказывают вместе. Пространственное внимание охватывает четыре представления, и модель рисует общий мир, мяч и чужие машины одинаково со всех четырёх ракурсов за один проход. Физическое состояние игры (позиции, скорости, ориентации мяча и машин) логируется отдельно на 120 Гц. Мировая модель его не видит и учится только на пикселях и действиях. Это состояние нужно как эталонная разметка для проверки: по нему авторы смотрят, кодирует ли модель в своих признаках физически осмысленные величины.

Видео-кодек MIRA даёт заметный рост качества по сравнению с предсказанием прямо в пикселях. Метрики gFID и gFVD измеряют, насколько сгенерированное видео похоже на настоящее (чем меньше, тем лучше): с кодеком 10.7 и 163.1 против 104.9 и 1456.3 без него. Метрика ARR показывает, насколько точно модель отрисовывает нажатые кнопки (1.0 = идеал): с кодеком 0.91 против 0.61. На практике без кодека картинка сваливается в искажённую текстуру уже через секунду.

Авторы опубликовали код обучения и инференса на Github, а также датасет на Hugging Face. Поиграть самостоятельно можно в демо-режиме на сайте проекта.

#Stateoftheart
  • 🔥 10
  • ❤ 4
  • 👍 2
  • 🤩 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →