Diffusion Models Are Real-Time Game Engines [сайт]
Диффузку научили предсказывать новый кадр на основе прошлых + conditioned on actions на примере DOOM в 50 FPS. получилась ИИ-игра
Авторы исследовали а-ля "DLSS Frame Generation", но с подачей нажатых клавиш, Fig. 10
Из интересного:
1️⃣ Число сохраненных прошлых кадров на самом деле не сильно улучшает метрики. Хватает всего 2-4, Table 1
2️⃣ Перформанс упирается в число итераций денойзинга. 10 ms/step. Обычно нам требуется 20-100 шагов (DDIM). Но из-за когерентности кадров хватает всего 4 шагов => 40 ms, Table 3
В чём же крутость работы?
1️⃣ Устаревшая SD 1.4 может симулировать простую но динамическую игру. Но для этого нужен датасет
2️⃣ Диффузки уже ускоряли на порядки (Imagine Flash, SDXL) и они работают в real-time на RTX. Т.к. они лучше проецируются на ГПУ, нежели чем игровые-движки, с FPS еще можно сделать многое
Главный вопрос:
Можно ли будет диффузки использовать как DLSS 5.0 (или даже как рендер), открыв доступ к логическому состоянию игры?
#ии
Post #142
497