⚔️🤖 Qwen3.8-27B в 11,8 Гбайт: новая схема квантизации GSQ+RCO
Для Qwen3.8-27B появилась новая квантизированная версия, позволяющая сократить размер модели с 53,8 до 11,8 Гбайт при практически полном сохранении результатов исходной BF16-модели. В отличие от обычного уменьшения разрядности всех весов по одной схеме, здесь используется сочетание технологий GSQ и RCO, позволяющее по-разному сжимать отдельные части нейросети.
🔻 GSQ (Gumbel-Softmax Quantization) выполняет низкобитное квантование весов с дополнительной оптимизацией их представления. Метод рассчитан прежде всего на диапазон 1–3 бита на параметр и при этом сохраняет обычное скалярное представление весов, совместимое с существующими средствами запуска GGUF.
🔻 RCO (Riemannian Constrained Optimization) решает другую задачу – определяет, какую степень сжатия использовать для каждого отдельного массива весов модели при заданном общем размере.
Иными словами, вся Qwen3.8-27B не переводится условно в одинаковые «3 бита». Более чувствительные к квантизации части получают более точное представление, а там, где влияние на результат минимально, применяется более сильное сжатие. После этого полученная комбинация укладывается в заданный объём памяти.
📌 Для Qwen3.8-27B опубликованы четыре основные версии:
– IQ2_XS – 8,4 Гбайт / 2,50 bpw;
– IQ2_S – 9,3 Гбайт / 2,75 bpw;
– IQ3_XXS – 10,1 Гбайт / 3,00 bpw;
– IQ3_S – 11,8 Гбайт / 3,50 bpw скачать IQ3_S.
bpw (bits per weight) – среднее число бит, приходящееся на один вес модели после квантизации. Чем ниже этот показатель, тем меньше требуется памяти для хранения весов. В GSQ+RCO это именно среднее значение по всей модели, поскольку разные её части могут сохраняться с различной разрядностью.
Наиболее интересна IQ3_S. В испытаниях разработчиков исходная BF16 и квантизированная модель показали одинаковые результаты. Среднее значение по трём тестам составило около 99,8% результата BF16.
Поэтому заявление «локальный запуск практически без снижения точности модели» следует понимать не как математически полное отсутствие изменений после квантизации, а как практически полное сохранение возможностей модели на проверенных задачах.
🔻 Практическое значение заключается в другом.
27-миллиардную плотную модель теперь можно использовать на обычной персональной рабочей станции, не переходя к намного меньшей 7–14B-модели только из-за ограничений видеопамяти.
Например, при 16 Гбайт VRAM версия IQ3_S уже становится значительно более реалистичным вариантом: около 11,8 Гбайт занимают веса, а оставшаяся память используется под KV-кэш, рабочий контекст и служебные данные. При 24 Гбайт VRAM появляется заметно больший запас под длинный контекст, мультимодальность и работу агентных инструментов.
🔻 При этом используется обычный формат GGUF. Отдельный специализированный сервер для GSQ или RCO после скачивания модели не нужен. Готовый файл можно запускать через llama.cpp, а также совместимые с GGUF локальные оболочки.
Для мультимодального режима отдельно опубликован файл mmproj размером около 0,9 Гбайт, содержащий модуль обработки изображений и модуль сопряжения с языковой моделью. Поэтому локальная Qwen3.8-27B может применяться не только для текста, но и для анализа изображений, страниц документов, схем и других визуальных материалов.
Предусмотрены также варианты с MTP (Multi-Token Prediction). Они примерно на 350 Мбайт крупнее и позволяют использовать многотокенное прогнозирование для ускорения генерации в поддерживающих эту функцию версиях llama.cpp.
🔵 Для локального аналитического агента GSQ+RCO особенно интересна тем, что меняет сам компромисс между размером и качеством модели. Раньше 10–12 Гбайт памяти обычно означали либо сравнительно небольшую модель, либо заметно ухудшенную 27B-квантизацию. Здесь в тот же диапазон помещается полноценная Qwen3.8-27B, сохраняющая почти весь результат исходной модели.
В результате освободившуюся видеопамять можно расходовать не на сами веса, а на то, что действительно требуется агенту: контекст, работу с документами, изображения, инструменты, несколько параллельных задач и длительное исследование.
Post #1726
68
- 👍 1