Полгода назад «запустить LLM у себя» означало игрушку, которая путается в коде. Сейчас на 16 ГБ памяти без видеокарты работает мультимодальная модель, а на Mac Studio крутится GLM-5.3-Flash, которую Z․ai сравнивает с Opus 4.8. Ниже конкретика по справочнику Unsloth, чтобы не искать самим.
Сначала поставьте Ollama (Windows, macOS, Linux), дальше одна команда в терминале:
16 ГБ, без GPU: Gemma 4 12B в 4 битах, 7–8 ГБ на диске:
ollama run gemma4:12b32 ГБ или видеокарта на 16 ГБ: Qwen3․8-27B, 4 бита, 16–19 ГБ, понимает картинки и умеет рассуждать:
ollama run qwen3.8:27bMac на 64 ГБ: Qwen3․6-35B-A3B, MoE с 3 млрд активных из 35, поэтому быстрая:
ollama run qwen3.6:35b-mlx128 ГБ (Mac Studio, DGX Spark): GLM-5.3-Flash в 3 битах (нужно 128–150 ГБ памяти) или DeepSeek-V4-Flash в 3 битах, 103 ГБ. В Ollama их нет. Путь через Unsloth:
curl -fsSL https://unsloth.ai/install.sh | sh, затем unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS. Через llama.cpp нужна ветка glm5next/upstream из форка Unsloth, сборка и команды в том же гайде.Kimi K3 и Qwen3․8 на 2,4 трлн не влезают даже в 128 ГБ: минимальный квант от 400 ГБ.
Полные таблицы требований лежат в каталоге Unsloth. Если у вас Mac с 24 ГБ, берите Qwen3․8-27B: Unsloth прямо пишет, что 4-битный квант рассчитан на такую память.
#ии