Diffusion for World Modeling: Visual Details Matter in Atari
в продолжение темы про модели мира
в основном используют дискретные автоэнкодеры, ибо с дискретными латентами снижается проблема накопительной ошибки при процессинге данных. но в более сложных задачах дискретизация может быть чревата слишком сильной потерей инфрмации, отчего все плоховато. в принципе можно тогда увеличивать количество дискретных эмбеддингов, но и повышаются требования на компьют. а какая есть альтернатива - диффузия🤑🤑🤑
и в качестве решения используют score-based diffusion, а именно EDM (есть так же сравнение результатов с обычным DDPM), где таргет адаптивно миксует signal-to-noise ratio в соотношении с нойз шедулингом. в качестве чистого таргета выступает фиксированная последовательность из предыдущих интеракций. а интуитивно такие трюки с адаптивным таргетом нужны для того, чтобы аутпуты модели оставались вариативными (в силу сложности задачи) когда шума мало.
правда авторы так же указывают, что для предикта реварда и флага терминации используются отдельные модели → диффузия не оч хороша в моделировании таких скаляров вместе с динамикой по состояниям, либо авторы не смогли нормально это прикрутить
по mean human normalized score обыгрываем все методы, на одну сотую только проигрывает по interquantile mean методу выше
👀LINK
Post #425
434





- 👍 5
- ❤ 1
- 🔥 1