💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти
Подборка для программирования, работы с изображениями и агентных задач.
Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.
🟢 8 ГБ
Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B
Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.
Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf
Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.
🔵 16 ГБ
Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it
Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.
🟣 24 ГБ
Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B
Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.
🟠 32–64 ГБ
Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini
Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.
🔴 96–128 ГБ
Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next
Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.
GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw
Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.
⚙️ 192–256 ГБ
DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.
Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro
Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.
GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw
Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.
GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4
Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.
🖥 384–512 ГБ
GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3
Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.
Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.
Post #5740
4.34K

- 👍 11
- ❤ 7
- 🔥 4
- 🤣 3
- 🥱 1