Разбор whitepaper о vLLM: KV-кеш, PagedAttention и быстрый инференс | Research Insights #32 (Рубрика #Inference)
Модель поместилась в GPU, тестовый запрос отработал быстро. Что произойдёт, когда одновременно придут сотни запросов с разной длиной контекста и ответа?
28 сентября 2026 года в 11:00 по мск в прямом эфире Research Insights Made Simple #32 разберу whitepaper 2023 года про vLLM и устройство инференса LLM: как управление памятью, планирование запросов и передача состояния между узлами влияют на скорость сервиса.
Начнём с KV-кеша — ключей и значений уже обработанных токенов, которые модель сохраняет для следующих шагов генерации. Посмотрим, как PagedAttention применяет идеи виртуальной памяти к этому кешу и позволяет эффективнее размещать активные запросы на GPU. А дальше разберём, какие задачи приходится решать вокруг движка.
Выпуск для инженеров, архитекторов и платформенных команд, которые разворачивают LLM, выбирают движок инференса или хотят понять, что происходит за API модели.
Исследование PagedAttention, SOSP 2023: "Efficient Memory Management for Large Language Model Serving with PagedAttention"
Все выпуски Research Insights Made Simple доступны на сайте
Напишите в комментариях, во что упирается ваш инференс: память, ожидание первого токена, паузы при генерации или стоимость обслуживания.
#vLLM #LLM #ResearchInsights #RnD #Infrastructure #DistributedSystems #OpenSource
Post #4986
1.03K