GFusion: как диффузионный подход ускорил GigaChat ⚡️
Команда GigaChat представила проект GFusion — диффузионную языковую модель на базе GigaChat3-10B-A1.8B-base. В отличие от классического авторегрессионного подхода, где текст генерируется строго по одному токену, диффузионная LLM восстанавливает за один проход сразу несколько токенов внутри замаскированного блока.
Весь проект — от идеи и обучения до оптимизации runtime и open-source релиза — выполнил стажер команды Pretrain. Новый метод позволяет увеличить скорость генерации в однопользовательском режиме в среднем на 70% по сравнению с базовой моделью, при этом снижение качества составило всего 2–4 п.п., а балансом скорости и точности можно управлять через параметры генерации.
В ходе работы команда добавила поддержку GFusion в SGLang и реализовала алгоритм entropy-bounded sampling для ускорения диффузионных моделей. Кроме того, в open source была выложена собственная реализация attention на TileLang под структуру диффузионной маски, которая дает до +77% end-to-end ускорения на длинном контексте.
➡️Подробности исследования, код и веса моделей в статье на Habr, а также на GitVerse и Hugging Face: GFusion-10B-A1.8B-base, GFusion-10B-A1.8B
Post #1675
1.08K

- ❤ 3
- 🔥 1