Поэтому я решил: надо поставить себе хотя бы пару локальных моделей, чтобы была возможность с ними общаться без сети, а заодно получить возможность бесплатно тестировать какие-то гипотезы, в которых нужны LLM'ки.
Если вам кажется, что развёртывание веб-интерфейса а-ля ChatGPT локально — это сложно, то вот вам короткий гайд, как всё настроить на MacOS. На Windows и Linux — тоже можно, инструкции есть на сайтах проектов, все ссылки тоже будут в инструкции.
Что хочу сделать дальше - поднять у себя полноценную систему с RAG (Retrieval-Augmented Generation). Если кто-то уже делал такое упражнение, будет круто, если поделитесь своим опытом в комментах.
⸻
1. Установка движка для моделей — Ollama
Я выбрал Ollama, хотя есть ещё пара альтернатив. Это такая удобная обёртка, которая позволяет запускать LLM’ки локально без плясок с бубном. Скачать можно отсюда: https://ollama.com/download
После установки нужно запустить выбранную вами модель через терминал. Например, если вы хотите llama3.2, то команда будет выглядеть так:
ollama run llama3.2
Ollama сама скачает указанную модель при первом запуске.
Список всех доступных моделей — тут: https://ollama.com/library
Я себе поставил:
- llama3.2
- gemma3
- deepseek-r1
Все 3 модели достаточно бодро работают на MacBook Pro M4 Pro, 24GB. Выбирал скорее интуитивно. Как сравнивать модели по качеству результатов в конкретных задачах — это пока один из самых интересных вопросов для меня 🤷♂️
В принципе, уже на этом этапе вы можете общаться с моделью в терминале или через API, например, вот так:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"stream": false
}'Соответственно, в терминале, Postman, VS Code и всём, где вам удобно, уже можно пользоваться моделью. Подробнее про API (оно не OpenAI совместимое!) вот тут https://github.com/ollama/ollama/blob/main/docs/api.md
⸻
2. Добавляем “нормальный” интерфейс
Но я хотел что-то попроще, чем API-запросы, поэтому добавил ещё Open WebUI — веб-интерфейс, похожий на ChatGPT. Тут тоже всё просто, хотя сначала вам нужно будет поставить Docker — если вы не разработчик, то, скорее всего, он у вас не установлен. Так что начнём с него: https://www.docker.com/get-started/
После установки Docker запускаем Open WebUI:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data --name open-webui --restart always \
ghcr.io/open-webui/open-webui:main
Чуть подробнее об этом можно почитать тут: https://docs.openwebui.com/
Но, вообще, уже сейчас можно открыть в браузере http://localhost:3000/ — и всё должно заработать ✨
Бонус: теперь все модели, которые у вас установлены в Ollama, можно использовать не только через её API, но и через OpenAI-совместимый API, который предоставляет Open WebUI.