TGViewer
Машинное обучение RU Машинное обучение RU @machinelearning_ru · 18.2K subscribers
Post #2731 2.22K
✔️ Nano‑vLLM — реализация vLLM, написанная с нуля1

Это минималистичный, но быстрый движок для офлайн-инференса LLM. Отлично подойдёт для локальных экспериментов и кастомных решений.

📌 Ключевые фичи:
🚀 Быстрый офлайн-инференс — почти как у vLLM
📖 Простой и читаемый код — всего ~1200 строк на Python
⚡ Оптимизации: prefix caching, Torch compilation, CUDA Graph и др.

📦 Установка:

pip install git+https://github.com/GeeeekExplorer/nano-vllm.git


📌 Быстрый старт:
Примеры использования — в example.py.
API максимально похож на vLLM, за исключением метода LLM.generate.

📊 Бенчмарк (на RTX 4070 + модель Qwen3-0.6B):
• Запросов: 256
• Вход: от 100 до 1024 токенов
• Выход: от 100 до 1024 токенов

Результаты:
| Движок | Время (с) | Скорость (токенов/с) |
|--------------|-----------|----------------------|
| vLLM | 98.95 | 1353.86 |
| **Nano-vLLM**| 101.90 | **1314.65** |

💡 Nano‑vLLM показывает почти ту же производительность, что и оригинал, но с компактным и понятным кодом. Идеален для изучения и локальных LLM-проектов.

📌 Github
  • 🔥 5
  • ❤ 3
  • 👍 3
More from @machinelearning_ru
  1. Oct 4, 2026🇩🇪 Германия неожиданно выпустила сильную открытую модель ИИ Aleph Alpha выпустила Kolibr…
  2. Oct 3, 2026100 вопросов на Python Senior: к чему готовиться на собеседовании в 2026 Вышла подборка из…
  3. Oct 2, 2026🚨 SoftBank перевела финальные $10 млрд в OpenAI. Это третья и последняя часть обещанных $…
  4. Oct 1, 2026photo post
  5. Oct 1, 2026✔️ Президент США и главы ИИ-компаний подписали соглашение о безопасности Документ подписал…
  6. Sep 30, 2026🧠 Открытые нейросетевые фреймворки представили на главной конференции по рекомендательным…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →