Qwen3.8-Flash-Next: гибридное внимание для ИИ-агентов
👋 Qwen3.8-Flash-Next — экспериментальная мультимодальная MoE-модель: 125 млрд параметров в основной языковой модели, из которых 6 млрд активируются на токен. Она работает с текстом, изображениями и видео, поддерживает нативный контекст 262 144 токена и расширение до 1 млн с YaRN.
Что важно:
▪️ Разреженное глобальное внимание
Архитектура сочетает три рекуррентных слоя Gated DeltaNet с одним слоем Qwen Sparse Attention. QSA отбирает релевантные блоки токенов и вычисляет внимание по выбранному подмножеству, сокращая объем вычислений на длинном контексте.
▪️ N-граммные встраивания
Дополнительная таблица на 51 млрд параметров обогащает представления токенов векторами для коротких последовательностей. Она размещается в оперативной памяти хоста, поэтому всю таблицу не нужно хранить в VRAM.
▪️ Gated Residual
Четыре параллельные ветви остаточного потока обеспечивают управляемую передачу информации между слоями, расширяя возможности преобразования представлений.
📲 Подробнее об архитектуре, бенчмарках, сценариях использования и требованиях к инференсу — в слайдах.
➡️ Модель стоит протестировать на изменении кодовых баз, многошаговых задачах с инструментами и анализе больших документов.
☁️ Для проверки в собственной инфраструктуре модель доступна в Immers Foundation Models на конфигурации 2 × H100 от 703,08 ₽/ч.
#ИИ_Модели #LLM
Post #1402
133









- ❤ 2
- ⚡ 2