Материалы выпуска Research Insights #32: vLLM и PagedAttention (Рубрика #AI)
Собрал материалы сольного выпуска Research Insights Made Simple от 28 сентября 2026 года — про vLLM и PagedAttention. История о том, как идея страничной памяти из операционных систем помогла эффективнее обслуживать запросы к LLM. Это был разбор сентябрьской статьи 2023 года "Efficient Memory Management for Large Language Model Serving with PagedAttention"
Модель уже поместилась на GPU, но рядом с её весами нужно хранить ещё и KV-кеш — ключи и значения обработанных токенов для каждого активного запроса. Ответ растёт, кеш растёт вместе с ним, а будущая длина ответа заранее неизвестна. Если резервировать память с запасом, места для соседних запросов остаётся всё меньше. Вот тут и пригодился учебник по операционным системам.
В выпуске разобрал:
🔸 Куда уходит память
Резерв под будущие токены, незаполненные участки и фрагментацию — и почему даже знание длины ответа не решает все проблемы размещения.
🔸 Как устроен PagedAttention
Таблица связывает логические блоки запроса с физическими блоками GPU, а новые блоки выделяются по мере необходимости.
🔸 Как делить общий префикс
Несколько вариантов ответа используют одни KV-данные, а при изменении общего блока включается копирование при записи.
🔸 Что делать, когда память всё-таки закончилась
Перенести состояние в память CPU или удалить и потом вычислить заново: у каждого варианта своя цена.
🔸 Почему более медленное ядро может ускорить весь сервис
Экономия памяти позволяет обрабатывать больше запросов одновременно; результат нужно измерять вместе с задержкой.
В статье 2023 года авторы получили рост пропускной способности в 2–4 раза относительно FasterTransformer и Orca при сопоставимой задержке. Это результат их экспериментов с конкретными моделями и нагрузками. Для сегодняшнего сервера выигрыш придётся измерять заново.
Материалы выпуска:
📌 Страница выпуска с таймкодами
📊 Слайды
🎬 YouTube, VK Видео
🎧 Podster, Яндекс Музыка, Apple Podcasts
📝 Текстовый конспект
Если уже настраивали vLLM под свою нагрузку, расскажите в комментариях, во что упёрлись и что дало заметный выигрыш.
#AI #LLM #Inference #Architecture #ResearchInsights #Engineering
Post #5010
1.06K