На Hugging Face выкатили 18B «франкенштейн»-модель, которая бьёт 35B
Без дообучения. Просто сборка.
Модель на 18B обходит Qwen3.6-35B-A3B в наборе из 44 тестов,
при этом требует всего 12GB VRAM вместо 24GB.
И запускается на обычной RTX 3060.
Что внутри:
- смешанный reasoning от Opus 4.6 и GLM-5.1
- стабильная генерация 66+ токенов в секунду
- нормальная работа с tool calling
- подходит для агентных сценариев
Размер GGUF - около 9.8GB (Q4_K_M),
то есть спокойно помещается на карту с 12GB памяти.
Это не новая архитектура и не прорыв в обучении.
Это грамотная сборка уже существующих моделей.
Но результат интересный.
По сути получился компромисс между лёгкими 9B и тяжёлыми 27B+ моделями.
Достаточно умный, при этом не требовательный к железу.
Если у тебя 12–16GB VRAM — это сейчас один из самых удобных вариантов под локальный запуск.
https://huggingface.co/Jackrong/Qwopus-GLM-18B-Merged-GGUF
Post #2064
1.76K

- 👍 7
- ❤ 1