📌 В этом посте — подробная инструкция: от установки Ubuntu до запуска модели через vLLM в Docker.
📲 Листайте карусель, чтобы повторить шаги на своём сервере.
Все команды, код и ссылки:
1️⃣ Доступ из Python.
2️⃣ Подключитесь к серверу immers.cloud с образом Ubuntu 24.04 и драйверами NVIDIA.
3️⃣ Установите Docker:
sudo apt update
sudo apt install docker.io
4️⃣ Установите NVIDIA Container Toolkit (GPU в контейнере):
Инструкция NVIDIA.
5️⃣ Перезапустите Docker:
sudo systemctl restart docker
6️⃣ Запустите модель Qwen3-30B-A3B-AWQ:
sudo docker run --ipc=host --log-opt max-size=10m --log-opt max-file=1 --rm -it --gpus '"device=0,1"' --shm-size=32g --env "VLLM_USE_V1=0" -p 8000:8000 --mount type=bind,source=/home/ubuntu/.cache,target=/root/.cache vllm/vllm-openai:v0.10.0 --model cognitivecomputations/Qwen3-30B-A3B-AWQ --max-model-len 8000 --dtype half --gpu-memory-utilization 0.90 --disable-log-requests --no-enable-prefix-caching --tensor-parallel-size 2
7️⃣ Выбор модели: Hugging Face Models.
Пост подготовил наш амбассадор Виталий Кулиев — специалист в области современных AI/ML‑технологий.



