vLLM - простой, быстрый и недорогой сервис LLM для всех.vLLM обеспечивает бесперебойную поддержку более 200 архитектур моделей на платформе HuggingFace, включая:-
LLM-ы, работающие только с декодером (например, Llama, Qwen, Gemma)-
Mixture-of-Expert LLMs (например, Mixtral, DeepSeek-V3, Qwen-MoE, GPT-OSS).- гибридные модели (например,
Mamba, Qwen3.5)- мультимодальные модели (например,
LLaVA, Qwen-VL, Pixtral)- модели встраивания и поиска (например,
E5-Mistral, GTE, ColBERT)- reward модели и модели классификации (например,
Qwen-Math)Возможности:
- бесшовная интеграция с популярными моделями
Hugging Face.- высокопроизводительное обслуживание с использованием различных алгоритмов декодирования, включая параллельную выборку, поиск по лучу и другие.
- параллельная обработка тензоров, конвейеров, данных, экспертов и контекста для распределенного вывода
- потоковые выходы
- генерация структурированных выходных данных с использованием
xgrammar или guidance- парсеры вызова инструментов и логических рассуждений
- сервер
API, совместимый с OpenAI, а также поддержка Anthropic Messages API и gRPC.- эффективная поддержка нескольких
LoRA для плотных и MoE-слоев.- поддержка графических процессоров
NVIDIA, AMD и процессоров x86/ARM/PowerPC. Кроме того, поддерживаются различные аппаратные плагины, такие как Google TPU, Intel Gaudi, IBM Spyre, Huawei Ascend, Rebellions NPU, Apple Silicon, MetaX GPU и другие.https://github.com/vllm-project/vllm
Опубликоввано в @gitgate
#ai #llm #api #openai #grpc #nvidia #amd #cpu
