services:
vllm:
image: "vllm/vllm-openai:v0.8.5.post1"
container_name: "vllm-qwen3"
runtime: nvidia
ulimits:
nofile: 65535
deploy:
resources:
reservations:
devices:
- capabilities: ["gpu"]
volumes:
- ./cache:/root/.cache/huggingface
environment:
- VLLM_USE_V1=0
- VLLM_ATTENTION_BACKEND="FLASH_ATTN"
#- HUGGING_FACE_HUB_TOKEN=<secret>
ports:
- "12900:8000"
ipc: host
entrypoint: "vllm serve Qwen/Qwen3-8B --host 0.0.0.0 --max-model-len 2K --enable-reasoning --reasoning-parser deepseek_r1"
Post #1700
452
Пример того, как в докеркомпозе можно запускать VLLM
- 👍 7