☺️ Alibaba показала архитектуру будущего Qwen4 и открыла веса ☺️
Qwen3.8-Flash-Next — мультимодальная MoE-модель и ранняя версия архитектуры, которая ляжет в основу Qwen4. В основной части 125 млрд параметров, но на каждом токене работают только 6 млрд. Ещё 51 млрд параметров вынесены в таблицу N-грамм, которую можно хранить в оперативной памяти.
Главная идея — не обрабатывать длинный контекст полным attention на каждом слое:
— три слоя Gated DeltaNet сжимают историю в состояние фиксированного размера;
— четвёртый слой через Qwen Sparse Attention находит важные участки исходного контекста.
Нативное окно составляет 262 тысячи токенов и расширяется до миллиона. По измерениям Alibaba, на миллионе токенов новый attention ускоряет загрузку контекста до 7,6 раза, а генерацию — до 4,9 раза относительно полного attention.
Для тебя здесь интересен архитектурный паттерн: длинную память агента можно разделить на дешёвое непрерывное сжатие и редкие точные обращения к исходной истории. Это экономнее, чем постоянно прогонять весь контекст через каждый слой.
Веса доступны, но модель занимает около 360 ГБ и распространяется по Qwen Community License 1.0, а не Apache 2.0.
Пруфы:
▶️репо Qwen
▶️веса и конфигурация модели
#llm #qwen #opensourceai #longcontext #moe #sparseattention
@data_engi
Post #1286
131