TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #740 1.74K
🔬 Метод

Ключевая идея — максимально сохранить знания базовой авторегрессионной модели, то есть её autoregressive prior.

Для этого входная последовательность дублируется в два потока:
1️⃣ Чистый поток — обычная авторегрессия.
2️⃣ Шумный поток — диффузионный. Он обусловливается на:

зашумленные токены внутри текущего блока;
чистые токены из предыдущих по времени блоков.

Лосс-функция одновременно оптимизирует:
• авторегрессионный лосс;
• диффузионный лосс размаскирования.

Для GDN рекуррентное состояние берётся из последнего чистого блока и дополняется вкладом зашумлённого блока.

Для генерации предлагаются два режима:

👉 Diffusion-Trust

По сути напоминает confidence-based unmasking: модель постепенно раскрывает наиболее уверенные токены.

👉 AR-Trust

Фактически вариант спекулятивного декодирования. Диффузионный поток предлагает токены, а авторегрессионный поток их проверяет.

Первый вариант обеспечивает более параллельную генерацию, но может терять в качестве. Второй позволяет сохранять качество на уровне, близком к исходной AR-модели.

🧪 Эксперименты

Первичные эксперименты проводят на Qwen3-1.7B (чистый Transformer).

Отдельное внимание уделяется выбору данных для адаптации. Авторы рассматривают различные смеси:
• CoT;
• Math;
• Instruction Following.

Наблюдение довольно интересное: хорошая смесь данных не должна ухудшать качество базовой модели уже после AR-SFT.

В итоге оказывается полезно смешивать данные из разных доменов. Финальный датасет содержит около 10B токенов.

В ablation показывают, что критически важны:

✅ сохранение авторегрессионного потока;
✅ наличие авторегрессионного лосса;
✅ сдвиг логитов на один токен в диффузионном потоке.

Далее авторы переходят к моделям семейства Qwen-3.5 (2B / 4B / 9B).

FLARE-9B в большинстве сценариев превосходит:
• LLaDA-2.0;
• LLaDA-2.1;
• SDAR.

Однако отставание от базовой Qwen-3.5-9B всё ещё остаётся довольно заметным.

Как и ожидалось, AR-Trust показывает лучшее качество, чем более параллельный Diffusion-Trust.

Отдельно авторы оптимизируют инфраструктурную часть:
• сравнивают Gated Delta Rule и ShortConv;
• подбирают размеры блоков;
• исследуют различные схемы чанкирования.

В результате MFU удаётся почти удвоить относительно бейзлайна.

По throughput результаты тоже выглядят достойно:

заметно быстрее SDAR-1.7B;
младшие модели существенно опережают LLaDA;
версия 9B также сохраняет преимущество по токенам/сек.

💡 Выводы

Работа выглядит очень интересной как практический рецепт превращения сильной авторегрессионной модели в гибридную диффузионную.

Главная проблема пока остаётся прежней: нет открытых моделей и кода. Если бы авторы выложили оба артефакта, ценность работы была бы значительно выше.

Также остаются открытые вопросы:
❓ Как выглядит end-to-end latency относительно AR-бейзлайнов?
❓ Насколько хорошо подход масштабируется на современные крупные MoE-модели вроде DeepSeek-V4, Minimax M3 или Qwen-3.5-397B?

Будет интересно посмотреть на продолжение этой линии работ.
More from @quant_prune_distill
  1. Oct 6, 2026Совпадение? Не думаю!
  2. Oct 5, 2026Теперь уже даже время прочтения блога это ориентир не для человека, а для LLMки. https://r…
  3. Oct 4, 2026"Горячие" эксперты
  4. Oct 4, 2026photo post
  5. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  6. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →