Nano-vLLM - облегченная реализация vLLM, созданная с нуля.
Это минималистичный движок для инференса LLM размером примерно 1200 строк кода на Python, который при этом показывает производительность на уровне vLLM и иногда даже выше.
Главная идея простая - дать быстрый, понятный и лёгкий движок, который можно разобрать буквально за вечер и адаптировать под свои задачи. Поддерживается кеширование, тензорный параллелизм и работа на GPU. Работает локально, без зависимости от облаков.
На тестах с моделью Qwen3-0.6B и 256 параллельными запросами Nano-vLLM показал скорость 1314.65 токенов/с против 1353.86 у vLLM. Разница не превышает 3%, при этом код Nano-vLLM проще и доступнее для модификаций.
Интерфейс совместим с vLLM, за исключением метода генерации. Примеры использования включены в репозиторий.
👉 @PythonPortal
Post #5117
9.86K

- ❤ 18
- 👍 5
- 👀 4
- 🔥 1