✔️ AR-GRPO — новый подход к улучшению авторегрессионных моделей генерации изображений с помощью RL
Исследователи представили AR-GRPO, метод интеграции обучения с подкреплением (online RL) в авторегрессионные (AR) модели генерации изображений.
Он адаптирует алгоритм Group Relative Policy Optimization (GRPO), чтобы дообучать обычные AR-модели с учётом специально разработанных функций вознаграждения.
Эти функции оценивают сгенерированные изображения сразу по нескольким параметрам качества:
- Визуальная привлекательность (perceptual quality)
- Реалистичность (realism)
- Семантическое соответствие запросу (semantic fidelity)
В результате модель учится выдавать не только красивые, но и реалистичные картинки, точно отражающие смысл входного описания.
https://arxiv.org/abs/2508.06924
Post #1124
1.7K

- ❤ 6
- 👍 2
- 🔥 2