🧠 Локальный ИИ в 2026: что запускать на своём компьютере
Свой AI-ассистент без облака, подписок и слежки — реально уже сегодня. Из чего он состоит и что брать под вашу видеокарту.
Локальный ассистент = 3 части:
🔧 Движок — запускает модель (сам файл модели не работает, как mp3 без плеера)
🧠 Модель — отвечает, анализирует, пишет код
🖐 Агент — даёт модели доступ к файлам, IDE и терминалу
⚙️ Движки
• Ollama — простой старт, локальный API для агентов
• LM Studio — запуск моделей через GUI
• llama.cpp — полный контроль над памятью
• vLLM — серверный inference для команд
🤖 Модели по видеопамяти
6–8 ГБ → Qwen3 4B / 8B — чат, тексты, простой код
12–16 ГБ → Qwen3 14B (универсал), DeepSeek-R1-Distill-14B (reasoning)
24 ГБ → Qwen3-Coder-30B-A3B (код), Qwen3.6-27B (универсал)
32 ГБ+ → Qwen3.6-35B-A3B; крупные DeepSeek V3/V4, Llama 4 — уже серверные
🔌 Через что работать
• Cline — coding-агент в VS Code
• OpenCode — агент для терминала и IDE
• Aider — правки через Git и diff
• Open WebUI — локальный чат в стиле ChatGPT
🚀 Готовые связки
• Ноут/слабая GPU → Ollama + Qwen3 4B/8B
• 12–16 ГБ → Ollama + Qwen3 14B + Open WebUI
• Код на 24 ГБ → Ollama + Qwen3-Coder-30B-A3B + Cline
• Универсал на 24 ГБ → Ollama + Qwen3.6-27B + Open WebUI
💡 Главное правило:
берите не самую «умную» модель, а самую большую, что влезает в видеокарту целиком. Что свисает на CPU — тормозит адски. И помните: размер файла ≠ потребление VRAM (память ест ещё контекст и KV-cache).
3 козыря локали: 🔒 данные не уходят на сторону · ✈️ офлайн · 💸 ноль подписок
💸 Нет мощной GPU? Арендуй по часам
Тот же стек можно гонять на арендованной карте. Бюджетный вариант — Vast.ai: для Qwen3-Coder 30B ищите инстанс с RTX 3090/4090/5090 или проф-картой 24+ ГБ. ⚠️ Это уже не локальный запуск — модель на чужом сервере. Не грузите приватные документы, ключи и закрытый код без шифрования и проверки хоста.
🔗 https://cloud.vast.ai/?ref_id=626108
Подробнее в статье на vc.ru
#AI #нейросети #ollama #localllm #разработка #технологии
Post #92
380