⚡️ LLaDA 2.0 превращает обычную LLM в diffusion-модель и ускоряет генерацию в разы
В работе LLaDA 2.0 показано, как превратить стандартную autoregressive LLM в diffusion language model, которая генерирует текст не по токену за шаг, а заполняет сразу много пропусков.
Ключевые цифры
- Масштаб модели - 100B параметров
- Скорость генерации - 535 токенов в секунду
- Примерно в 2.1 раза быстрее сопоставимых autoregressive моделей
В чем проблема autoregressive подхода
Классические LLM предсказывают текст строго последовательно:
- один токен за шаг
- следующий токен зависит от всех предыдущих
- генерация неизбежно идет шаг за шагом
Это делает инференс узким местом при больших моделях.
Как работает diffusion для языка
Diffusion language models обучаются иначе:
- текст намеренно портится - маскируется сразу много токенов
- модель учится восстанавливать пропуски, используя контекст слева и справа
- за один шаг можно заполнить сразу множество токенов
Подход LLaDA 2.0
- стартует с уже обученной autoregressive модели
- постепенно меняет паттерн маскирования:
- сначала маленькие блоки
- затем целые последовательности
- затем снова маленькие блоки
- запрещает «читать» через границы документов, что критично при упаковке множества коротких текстов
- для instruction tuning использует парные маски, чтобы каждый токен участвовал в обучении
- дополнительно поощряет уверенные предсказания, чтобы модель могла заполнять много пропусков за раз
- ускорение инференса без радикальной смены архитектуры
- реальная альтернатива autoregressive генерации на больших масштабах
- diffusion-подход начинает выглядеть практичным для LLM, а не только теоретическим
Это еще один сигнал, что будущее генерации текста может уйти от строго последовательного токен-за-токеном режима.
Paper: arxiv.org/abs/2512.15745
Post #1302
2.35K

- ❤ 8