TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #571 2.66K
🧪Эксперименты

Метод валидируют путем дообучения Dream-7B-Base, которую сначала учили на авторегрессию, а затем на диффузию.

Разметку для обучения собирают с помощью Gemini переформатируя примеры из Slim Orca в требуемый вид (план + ветви рассуждения). Неудачные примеры выбрасывают.

В качестве бейзлайнов берут просто авторегрессию, текстовую диффузию, и ускоренную диффузию Fast-dLLM.

Качество оценивают на AlpacaEval c LLM-as-a-judge, следуя некоему стандартному протоколу. Дабы получить лучший результат и честное сравнение для каждого из вариантов учат 2, 4, 8, или 16 эпох и выбирают лучшую модель. Для авторегрессии оптимальны 2 эпохи, для диффузионных постановок полезно учить подольше - 16 эпох.

Planned диффузия по качеству не сильно уступает авторегрессии, но при этом работает быстрее. В среднем удается добиться в 2.3 раза меньшего числа forward пассов по сравнению с AR, но конечное ускорение несколько меньше - 1.8x для независимых потоков, и 1.3x при dense-attention.

PD-DA несколько лучше по качеству, чем просто PD, но и медленнее (нельзя пропустить вычисления attention-а в некоторых блоках).

Далее ablaтят необходимость <topic> и <sync> тегов. При пропуске <topic> качество просаживается сильно, но от потери <sync> не сильно страдает и получается к тому же еще быстрее.

Кроме того, пробуют подавать на инференсе диффузии меньше или больше токенов, чем “спланировала” авторегрессия. Оптимальное качество достигается когда их столько же. Но если важна скорость - можно подавать более короткие цепочки [MASK] с умеренной просадкой.

💡 Выводы

На мой взгляд, довольно интересное исследование и постановка задачи. Как будто кажется естественным, что при работе над чем-то обьемным, мы сначала набрасываем план, черновик, а затем прорисовываем детали, шлифуем. Интересно, применима ли данная стратегия в других генеративных задачах и насколько масштабируется.
  • 🤔 4
  • ❤ 1
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →