TGViewer
DevOps Portal | Linux DevOps Portal | Linux @loose_code · 13.1K subscribers
Post #2046 2.92K
Разворачиваем Llama 3 с Docker и vLLM

Запуск LLM – это не просто поднять контейнер.

Здесь важны производительность, память и эффективное использование GPU.

В этом гайде разберём:
- Настройку GPU-окружения: Docker + NVIDIA Runtime
- Деплой модели с Llama и vLLM
- Оптимизацию памяти с помощью флага --gpu-memory-utilization, чтобы сбалансировать VRAM между весами модели и KV Cache
- Техники квантизации, которые позволяют увеличить throughput более чем в 2 раза — с 1,62 до 3,64 req/s — и вдвое сократить потребление VRAM
- Как работает Continuous Batching

Подробный гайд:
https://devopscube.com/deploying-llama-with-docker-and-vllm/

Следуя экспериментам по оптимизации из гайда, можно получить:
- рост общего throughput в 2,2 раза
- Time to First Token (TTFT) в 3 раза быстрее
- от 5 до 20+ одновременных пользователей на том же железе — NVIDIA RTX 4000

Примечание: этот гайд предназначен для обучения и экспериментов. Используйте его, чтобы разобраться в основных концепциях.

👉 DevOps Portal
  • ❤ 7
More from @loose_code
  1. Sep 26, 2026Docker 101: пробрасываем порт контейнера, чтобы открыть приложение с хоста Новое практичес…
  2. Sep 25, 2026Автоматизация платформы не отбирает у вас интересные задачи. Она забирает рутину. Deckhous…
  3. Sep 25, 2026Этот кейс показывает, как мигрировать с хрупкой инфраструктуры на базе EC2 на AWS EKS с Gi…
  4. Sep 25, 2026ИИ-агенты теперь могут работать как отдельные участники команды в GitLab В SourceCraft поя…
  5. Sep 25, 2026Анатомия Terraform-проекта До сих пор путаетесь в Terraform-файлах и структуре директорий?…
  6. Sep 24, 2026На Stepik вышла программа «DevOps с нуля: от Linux до Kubernetes» Это комплексная программ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →