Квантование & Прунинг & Дистилляция
Блог про сжатие сетей и не только.
От древнейших времен по настоящее время.
Группа с комментариями:
@quant_prune_distill_comments
Post #618
2.38K
🔬 Метод
🏘 Архитектура
📌 За основу берут подход VAR с TokenFlow токенизатором. Однако в последовательностях изображения могут входить теперь как желаемый выход, так и условие.
📌 Модель инициализируется из Qwen-2.5-VL-7B. Визуальные токены из кодбука добавляются в словарь. Пробовали раздельные головы для языка и зрения, но одна голова оказалась не хуже.
📌 Multiscale 3D RoPE. Координаты для текста реплицируются вдоль всех осей, для зрения нормализуют на размер изображения.
📌 В лоссе масштабируют на размер карты признаков, чтобы учесть разное количество токенов на разных уровнях.
📌 Сэмплирование из распределения с некоторой температурой на обучении вместо кодирования к ближайшему кодовому слову для устойчивости к шуму.
👨🏫 Стадии обучения
📌 Обучают суммарно на 6Т токенов.
📌 На первой стадии делают короткий alignment на 256px, где учат только коннектор и выходной слой.
📌 Затем обучают последовательно на разрешениях 256, 512, 1024.
📌 Потом делают SFT на данных более высокого качества.
📌 На финальной стадии гоняют GRPO, адаптированный к VAR. Градиенты пробрасываются только через 8 (из 10?) скейлов низкого разрешения.
Ко всему прочему обучают диффузионный декодер (а-ля refiner) для улучшения сэмплов, полученных из VAR.
🧪 Эксперименты
Модель выдает довольно хорошие метрики. Метрики на GenEval/DPG (что бы это ни значило) на уровне GPT-Image 1 и Qwen-Image.
На ImgEdit выдает около SOTA.
CoT-reasoning дает хороший профит по сравнению с генерацией без ризонинга. На черрипиках показывают, что модель выкручивается в спорных ситуациях.
💡 Выводы
Неплохой заход со стороны scalewise генерации. Но чтобы оценить по достоинству, требуется, чтобы community могло поиграться и сопоставить с тем что есть. Сможет ли оно догнать уровень SOTA-диффузии - время покажет.
🏘 Архитектура
📌 За основу берут подход VAR с TokenFlow токенизатором. Однако в последовательностях изображения могут входить теперь как желаемый выход, так и условие.
📌 Модель инициализируется из Qwen-2.5-VL-7B. Визуальные токены из кодбука добавляются в словарь. Пробовали раздельные головы для языка и зрения, но одна голова оказалась не хуже.
📌 Multiscale 3D RoPE. Координаты для текста реплицируются вдоль всех осей, для зрения нормализуют на размер изображения.
📌 В лоссе масштабируют на размер карты признаков, чтобы учесть разное количество токенов на разных уровнях.
📌 Сэмплирование из распределения с некоторой температурой на обучении вместо кодирования к ближайшему кодовому слову для устойчивости к шуму.
👨🏫 Стадии обучения
📌 Обучают суммарно на 6Т токенов.
📌 На первой стадии делают короткий alignment на 256px, где учат только коннектор и выходной слой.
📌 Затем обучают последовательно на разрешениях 256, 512, 1024.
📌 Потом делают SFT на данных более высокого качества.
📌 На финальной стадии гоняют GRPO, адаптированный к VAR. Градиенты пробрасываются только через 8 (из 10?) скейлов низкого разрешения.
Ко всему прочему обучают диффузионный декодер (а-ля refiner) для улучшения сэмплов, полученных из VAR.
🧪 Эксперименты
Модель выдает довольно хорошие метрики. Метрики на GenEval/DPG (что бы это ни значило) на уровне GPT-Image 1 и Qwen-Image.
На ImgEdit выдает около SOTA.
CoT-reasoning дает хороший профит по сравнению с генерацией без ризонинга. На черрипиках показывают, что модель выкручивается в спорных ситуациях.
💡 Выводы
Неплохой заход со стороны scalewise генерации. Но чтобы оценить по достоинству, требуется, чтобы community могло поиграться и сопоставить с тем что есть. Сможет ли оно догнать уровень SOTA-диффузии - время покажет.
- 🔥 2






