Где искать модели
• Hugging Face Hub - Главный каталог open-source моделей и чекпоинтов. Идите сюда, если нужен широкий выбор, форматы, квантования и контроль над тем, что именно скачиваете.
• Ollama Library - Удобный каталог моделей, которые можно быстро запускать локально через Ollama. Подходит для быстрого старта без лишней возни.
Чем запускать LLM локально
• Ollama Docs / Quickstart - Самый простой путь поднять локальную LLM. Хорошо подходит для пилота, одной машины и первых экспериментов.
• vLLM — OpenAI-Compatible Server - Нужен, если вы хотите уже нормальный сервер инференса для команды с API, совместимым с OpenAI-стилем.
• llama.cpp - Хороший вариант для GGUF, CPU/offline-сценариев и тонкого контроля над локальным запуском.
Чем делать оркестрацию и агентов
• LangGraph Overview - Нужен, если хотите надежные stateful workflow, human-in-the-loop и long-running процессы. Это уже инженерный слой, а не просто чатик с моделью.
• Dify — Self-host with Docker Compose - Удобен для быстрого self-hosted запуска AI-приложений и агентных workflow через готовый стек контейнеров.
• n8n — Docker Compose - Подходит, если у вас много интеграций, cron-задач, ETL и автоматизаций, а LLM — часть общего процесса.
UI для команды
• Open WebUI - Self-hosted интерфейс для работы с локальными моделями. Поддерживает Ollama и OpenAI-compatible backends, удобен как единая внутренняя точка входа.
RAG и поиск по внутренним знаниям
• pgvector - Если у вас уже есть PostgreSQL, это самый простой способ добавить vector search без отдельной базы.
• Qdrant Quickstart - Отдельный open-source векторный движок, если нужен более явный и выделенный RAG-слой.
Стандарт для подключения инструментов
• MCP Specification - Нужен, если хотите подключать данные и инструменты к агентам через стандартный протокол, а не на своих разрозненных костылях.
Post #180
92
- 👍 1
- 👎 1