vLLM утроила пропускную способность длинноконтекстных агентов
Команда vLLM показала Decode Context Parallelism: KV-кеш делится между GPU не по головам внимания, а по отрезкам контекста. Поэтому видеокартам не приходится хранить одинаковые копии длинной истории агента.
На одном сервере с 8×B200 и Kimi K2.6 производительность выросла с 1 863 до 6 091 токена/с на GPU. Тест использовал реальные агентные трассы с медианой около 67 тысяч токенов и хвостом до миллиона.
Если ты обслуживаешь много долгоживущих агентов, узким местом может быть не сама модель, а дублирование KV-кеша. В vLLM DCP включается одним параметром.
#ai #llm #vllm #inference #kvcache #gpu #agenticai
@data_engi
Post #1219
154