TGViewer
Complete AI Complete AI @complete_ai · 7.86K subscribers
Post #925 6.1K
⚡️ Диффузионные языковые модели: что в них работает, а что вызывает вопросы

Выложили большой разбор dLLM — результат совместной работы нескольких команд: «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI (@Ivan_Oseledets) и «Генеративная поэзия» Сергея Маркова (@oulenspiegel_channel) SberAI.

tldr: год возились с диффузионными языковыми моделями — воспроизводили чужие методы, обучали свои, ускоряли инференс. Разобрали за вас целое поле и рассказываем, что уже стоит брать, а куда пока лучше не вкладывать время.

Для тех, кто не в теме: dLLM генерируют текст не по одному токену слева направо, а параллельно, раскрывая замаскированные позиции по всей последовательности. Отсюда обещание кратного ускорения — но на практике всё упирается в KV-кэш, который в классической диффузии нормально не работает.

Мы разобрали три подхода — и вот что у нас получилось:

Адаптация — переучить готовую LLM в диффузионную за небольшую долю стоимости исходного претрейна. Сегодня это основной путь к большим dLLM — так получают модели вплоть до сотен миллиардов параметров.
У нас DiffuGPT/DiffuLLaMA не воспроизвёлся: нашли и исправили кучу проблем в коде, прогнали на GPT-2, Qwen и GigaChat — но генерация всё равно осталась плохой. Зато ReFusion + GigaChat 3B завёлся: 2,7× ускорение по wall-clock и более чем 2× рост на GSM8K.

Обучение с нуля — дорого и почти всегда не нужно в прикладном сценарии, но без него сложно проверять методические гипотезы. Разбираем MDLM как полигон для экспериментов и Eso-LM, где ради работающего KV-кэша пожертвовали двунаправленным вниманием.

Дистилляция — ускорить уже обученную модель, сократив число шагов расшумления. Рассказываем про свой метод IDLM (ICML 2026): для MDLM число шагов сокращается с 1024 до 16.

В конце — таблица с рекомендациями: какой подход выбирать под конкретную задачу и ограничения.

👉 Хабр
  • ❤ 22
  • 🔥 5
  • 👍 2
More from @complete_ai
  1. Sep 17, 2026AI + разработка — Senior-разработчиков ждут в Ozon Tech В компании развивается новое напра…
  2. Sep 7, 2026Мы выложили программу Practical ML Conf 2026 Я уже не первый год состою в программном коми…
  3. Sep 5, 2026Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯 В сети разошлась табл…
  4. Aug 20, 202617 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, р…
  5. Aug 20, 2026Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про бе…
  6. Aug 14, 2026🔥 GLM-5.3 от Z.ai — главное за 30 секунд: Чистый post-training. Та же базовая модель —GLM…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →