Qwen3.8-27B — компактный монстр от Alibaba Cloud
🔹 Что это за модель
Qwen3.8-27B — это dense (плотная) языковая модель с визуальным кодировщиком на 27 миллиардов параметров. Нативно понимает текст, картинки и видео. Архитектура гибридная: 64 слоя, hidden dimension 5120, контекст 262K токенов (расширяется до 1M). Реально держит длинные документы, кодовые базы и видео длительностью до часа без потери связности.
🔹 Чем лучше предыдущих поколений
• Значительный прирост в кодинге — 79.0 на QwenSWEBench против 49.3 у Qwen3.6-27B.
• SWE-bench Pro 61.7 — выше, чем у Opus4.6 Max (53.4).
• DeepSWE 1.1 — 42.2 против 13.3 у прошлого поколения. Реальный рост, а не маркетинг.
• IFBench 79.5 — почти лучший результат в индустрии по следованию инструкциям.
• GPQA Diamond 89.2 — сильные научные рассуждения.
🔹 Для чего подходит
• Автономные агенты с многошаговой логикой (CoWorkBench 70.7 — топ).
• Программирование: от автодополнения до рефакторинга целых репозиториев (NL2Repo-Bench 42.3).
• Анализ документов, схем, графиков, скриншотов интерфейса.
• Понимание длинных видео (до часа) — нативно, без костылей.
• Гибкое управление «мышлением»: режим рассуждений включается по запросу, глубина настраивается параметром reasoning_effort.
🔹 Гибридная архитектура
Внутри 16 блоков по схеме «3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)». Проще говоря, основная масса слоёв — линейное внимание DeltaNet (быстрое и экономное), а каждый 16-й слой — классический full attention для точности на длинных зависимостях. На практике это даёт и скорость, и качество.
🔹 Запуск на 16 ГБ видеокарты
Оригинал в BF16 весит 55.6 ГБ — на одну карту не влезает. Но у ребят из Unsloth есть готовые GGUF-кванты под llama.cpp. Для 16 ГБ VRAM оптимальный вариант — Q2_K_XL (9.83 ГБ) или UD-IQ3_XXS (10.9 ГБ). Качество падает на 6-8% но модель всё еще способна на многое.
🔹 Для 27 ГБ VRAM UD-Q4_K_M (16.5 ГБ) Это «золотая середина»: качество падает минимально (потери ~3-5% на бенчмарках), а скорость генерации остаётся комфортной.
🔹 Для 32ГБ VRAM отличная UD-Q5_K_XL (20.9 ГБ).
По ссылке ниже — официальный репозиторий Unsloth на Hugging Face, с моделями с динамическими квантами GGUF - Dynamic 3.
Qwen3.8-27B-GGUF (Dynamic 3) на Hugging Face
Мои ресурсы:
🔹 stabledif.ru/comfyui
🔹 boosty.to/stabledif
🔹 stabledif.ru/stream
🔹 max.ru/stable_dif
🔹 vk.ru/stabledif
Post #9951
834