Nano-vLLM - облегченная реализация vLLM, созданная с нуля.Возможности:
- быстрый офлайн-вывод - скорость вывода сравнима с
vLLM
- читабельная кодовая база - чистая реализация примерно в 1200 строках кода Python
- набор для оптимизации - кэширование префиксов, тензорный параллелизм, компиляция Torch, график CUDA и т. д.https://github.com/GeeeekExplorer/nano-vllm
Опубликовано в @gitgate
#llm #ai
