Запуск LLM – это не просто поднять контейнер.
Здесь важны производительность, память и эффективное использование GPU.
В этом гайде разберём:
- Настройку GPU-окружения: Docker + NVIDIA Runtime
- Деплой модели с Llama и vLLM
- Оптимизацию памяти с помощью флага
--gpu-memory-utilization, чтобы сбалансировать VRAM между весами модели и KV Cache- Техники квантизации, которые позволяют увеличить throughput более чем в 2 раза — с 1,62 до 3,64 req/s — и вдвое сократить потребление VRAM
- Как работает Continuous Batching
Подробный гайд:
https://devopscube.com/deploying-llama-with-docker-and-vllm/
Следуя экспериментам по оптимизации из гайда, можно получить:
- рост общего throughput в 2,2 раза
- Time to First Token (TTFT) в 3 раза быстрее
- от 5 до 20+ одновременных пользователей на том же железе — NVIDIA RTX 4000
Примечание: этот гайд предназначен для обучения и экспериментов. Используйте его, чтобы разобраться в основных концепциях.
👉 DevOps Portal
