Alibaba выкатила превью архитектуры будущего Qwen 4 и это не очередной МоЕ
Главная проблема локального ИИ: чтобы модель стала умнее, её делают тяжелее — добавляют параметров
Модель съедает всю видеопамять и начинает тормозить. Qwen обошел это тремя архитектурными хаками
🔵ПЕРВЫЙ — ОТДЕЛЬНАЯ ТАБЛИЦА
Вынос из видеопамяти 51 млрд параметров (таблица частых паттернов) теперь лежат не в VRAM, а в обычной оперативке или даже на быстром NVMe SSD (не советую, ссд умрет от такой движухи)
Модель не тратит вычислительную мощность на простые фразы, а просто подглядывает в RAM
Видеокарта занимается только сложной логикой
🔵ВТОРОЙ — Гибридное внимание
Раньше модель держала в памяти каждое слово длинного текста, и KV-кэш раздувался до небес
Теперь 75% слоев сжимают историю в компактную выжимку, а остальные 25% ищут информацию не по отдельным токенам, а целыми микроблоками
Можно скормить книгу на 1000 страниц или гигантский репозиторий, и память не лопнет, а скорость не упадет
🔵ТРЕТИЙ — Экстремальный MoE
Общий размер модели — 125 млрд параметров
Но для генерации одного токена активируются всего 6 млрд.
Эрудиция гиганта, а по скорости и потреблению памяти она ведет себя как легкая моделька на 7 млрд
Где подвох?
— Нужен комп на 128 ГБ видео/оперативной памяти. Такое есть далеко не у всех
— Зато по мощности как Opus 4.8 = очень круто ...
✈️ Ссылки
— Сама модель Unsloth GGUF: https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
— Тех.разбор: https://habr.com/ru/articles/1075526/
👍 — беру кредит на собственный датацентр
🪐 Вездесущий ИИ | Чат с админом | Консультация
