TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #5010 1.06K
Материалы выпуска Research Insights #32: vLLM и PagedAttention (Рубрика #AI)

Собрал материалы сольного выпуска Research Insights Made Simple от 28 сентября 2026 года — про vLLM и PagedAttention. История о том, как идея страничной памяти из операционных систем помогла эффективнее обслуживать запросы к LLM. Это был разбор сентябрьской статьи 2023 года "Efficient Memory Management for Large Language Model Serving with PagedAttention"

Модель уже поместилась на GPU, но рядом с её весами нужно хранить ещё и KV-кеш — ключи и значения обработанных токенов для каждого активного запроса. Ответ растёт, кеш растёт вместе с ним, а будущая длина ответа заранее неизвестна. Если резервировать память с запасом, места для соседних запросов остаётся всё меньше. Вот тут и пригодился учебник по операционным системам.

В выпуске разобрал:
🔸 Куда уходит память
Резерв под будущие токены, незаполненные участки и фрагментацию — и почему даже знание длины ответа не решает все проблемы размещения.
🔸 Как устроен PagedAttention
Таблица связывает логические блоки запроса с физическими блоками GPU, а новые блоки выделяются по мере необходимости.
🔸 Как делить общий префикс
Несколько вариантов ответа используют одни KV-данные, а при изменении общего блока включается копирование при записи.
🔸 Что делать, когда память всё-таки закончилась
Перенести состояние в память CPU или удалить и потом вычислить заново: у каждого варианта своя цена.
🔸 Почему более медленное ядро может ускорить весь сервис
Экономия памяти позволяет обрабатывать больше запросов одновременно; результат нужно измерять вместе с задержкой.

В статье 2023 года авторы получили рост пропускной способности в 2–4 раза относительно FasterTransformer и Orca при сопоставимой задержке. Это результат их экспериментов с конкретными моделями и нагрузками. Для сегодняшнего сервера выигрыш придётся измерять заново.

Материалы выпуска:
📌 Страница выпуска с таймкодами
📊 Слайды
🎬 YouTube, VK Видео
🎧 Podster, Яндекс Музыка, Apple Podcasts
📝 Текстовый конспект

Если уже настраивали vLLM под свою нагрузку, расскажите в комментариях, во что упёрлись и что дало заметный выигрыш.

#AI #LLM #Inference #Architecture #ResearchInsights #Engineering
polomodov.tech vLLM и PagedAttention: виртуальная… - Research Insights Made Simple Разбор статьи о vLLM и PagedAttention: почему инференс LLM упирается в память KV-кеша, как страничная виртуальная память из операционных систем убрала резерв и…
  • ❤ 4
  • 👍 2
  • 🔥 1
More from @book_cube
  1. Sep 30, 2026Залетайте в прямой эфир про профит от данных, который начнется через 5 минут. Там наше тво…
  2. Sep 30, 2026Начал вчера вечером читать книгу "Человек из будущего" про Джона фон Неймана. Треть книги…
  3. Sep 29, 2026Интересно смотреть в прямом эфире, а что Сэм расскажет про планы и результаты OpenAI Ниже…
  4. Sep 29, 2026Где деньги в своих данных: цены, клиенты, ассортимент | Где профит от данных, Лебовски #00…
  5. Sep 29, 2026Мы проводим Heisenbug уже 10 лет и каждый раз задумываемся: какие темы волнуют людей в это…
  6. Sep 29, 2026Друзья из JUG.RU проводят исследование по поводу состояния дела в тестировании. Возможно,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →