Квантование & Прунинг & Дистилляция
Блог про сжатие сетей и не только.
От древнейших времен по настоящее время.
Группа с комментариями:
@quant_prune_distill_comments
Post #534
1.92K

Диффузия против авторегрессии
[Статья] [Код статьи] [Критикующий её блогпост]
📘 Введение
На текущий момент генеративный мир делят авторегрессионная и диффузионная парадигмы. Первая себя лучше показывает в задачах работы с последовательностями общего вида, вторая — при работе с данными, обладающими некой пространственно-временной структурой.
За последний год было несколько интересных заходов в текстовые генеративки. Основной value proposition — более быстрая генерация за счёт параллельной генерации многих токенов за раз. Но по качеству, при заданном размере модели и бюджете обучения, авторегрессионки всё ещё выглядят предпочтительнее.
Есть ещё один аспект, который может дать мотивацию к использованию текстовых диффузионок — максимально достижимое качество в условиях ограниченного количества данных. И данный вопрос является темой обсуждения ниже.
[Статья] [Код статьи] [Критикующий её блогпост]
📘 Введение
На текущий момент генеративный мир делят авторегрессионная и диффузионная парадигмы. Первая себя лучше показывает в задачах работы с последовательностями общего вида, вторая — при работе с данными, обладающими некой пространственно-временной структурой.
За последний год было несколько интересных заходов в текстовые генеративки. Основной value proposition — более быстрая генерация за счёт параллельной генерации многих токенов за раз. Но по качеству, при заданном размере модели и бюджете обучения, авторегрессионки всё ещё выглядят предпочтительнее.
Есть ещё один аспект, который может дать мотивацию к использованию текстовых диффузионок — максимально достижимое качество в условиях ограниченного количества данных. И данный вопрос является темой обсуждения ниже.
- 👍 3





