MacBook Pro с 24 ГБ — это уже полноценная локальная AI-станция.
Qwen 3.5-9B при квантизации Q4 выдаёт ~40 токенов в секунду, поддерживает контекст 128K, режим «размышления» и работу с инструментами. Без интернета, без API-ключей, без передачи данных в чужие облака. Всё это помещается в LM Studio рядом с десятком открытых вкладок.
Но есть нюанс: настройка занимает время. Выбор между Ollama, llama.cpp и LM Studio, подбор квантизации, параметры вроде K Cache Quantization Type — это отдельная работа. Модели, которые «технически помещаются» в память (24B, 20B), на практике работают неприемлемо медленно. 9B Q4 — золотая середина.
Локальный AI не заменит SOTA-модели для сложных задач. Но для исследований, планирования и кода в интерактивном режиме — это работает. 👾
Разобрали, как использовать это на практике 👉 Читать на платформе
ИИ Инструменты | Контент-завод | База знаний
Post #95
39

- 🔥 1