🔬 Метод
Ключевая идея — максимально сохранить знания базовой авторегрессионной модели, то есть её autoregressive prior.
Для этого входная последовательность дублируется в два потока:
1️⃣ Чистый поток — обычная авторегрессия.
2️⃣ Шумный поток — диффузионный. Он обусловливается на:
зашумленные токены внутри текущего блока;
чистые токены из предыдущих по времени блоков.
Лосс-функция одновременно оптимизирует:
• авторегрессионный лосс;
• диффузионный лосс размаскирования.
Для GDN рекуррентное состояние берётся из последнего чистого блока и дополняется вкладом зашумлённого блока.
Для генерации предлагаются два режима:
👉 Diffusion-Trust
По сути напоминает confidence-based unmasking: модель постепенно раскрывает наиболее уверенные токены.
👉 AR-Trust
Фактически вариант спекулятивного декодирования. Диффузионный поток предлагает токены, а авторегрессионный поток их проверяет.
Первый вариант обеспечивает более параллельную генерацию, но может терять в качестве. Второй позволяет сохранять качество на уровне, близком к исходной AR-модели.
🧪 Эксперименты
Первичные эксперименты проводят на Qwen3-1.7B (чистый Transformer).
Отдельное внимание уделяется выбору данных для адаптации. Авторы рассматривают различные смеси:
• CoT;
• Math;
• Instruction Following.
Наблюдение довольно интересное: хорошая смесь данных не должна ухудшать качество базовой модели уже после AR-SFT.
В итоге оказывается полезно смешивать данные из разных доменов. Финальный датасет содержит около 10B токенов.
В ablation показывают, что критически важны:
✅ сохранение авторегрессионного потока;
✅ наличие авторегрессионного лосса;
✅ сдвиг логитов на один токен в диффузионном потоке.
Далее авторы переходят к моделям семейства Qwen-3.5 (2B / 4B / 9B).
FLARE-9B в большинстве сценариев превосходит:
• LLaDA-2.0;
• LLaDA-2.1;
• SDAR.
Однако отставание от базовой Qwen-3.5-9B всё ещё остаётся довольно заметным.
Как и ожидалось, AR-Trust показывает лучшее качество, чем более параллельный Diffusion-Trust.
Отдельно авторы оптимизируют инфраструктурную часть:
• сравнивают Gated Delta Rule и ShortConv;
• подбирают размеры блоков;
• исследуют различные схемы чанкирования.
В результате MFU удаётся почти удвоить относительно бейзлайна.
По throughput результаты тоже выглядят достойно:
заметно быстрее SDAR-1.7B;
младшие модели существенно опережают LLaDA;
версия 9B также сохраняет преимущество по токенам/сек.
💡 Выводы
Работа выглядит очень интересной как практический рецепт превращения сильной авторегрессионной модели в гибридную диффузионную.
Главная проблема пока остаётся прежней: нет открытых моделей и кода. Если бы авторы выложили оба артефакта, ценность работы была бы значительно выше.
Также остаются открытые вопросы:
❓ Как выглядит end-to-end latency относительно AR-бейзлайнов?
❓ Насколько хорошо подход масштабируется на современные крупные MoE-модели вроде DeepSeek-V4, Minimax M3 или Qwen-3.5-397B?
Будет интересно посмотреть на продолжение этой линии работ.
Post #740
1.74K