Post #5002
1.43K
Заходите на прямой эфир с разбором статьи про vLLM, где v означало вирутальную память - ключевую идею статьи еще 2023 года, чьи идеи теперь стали стандартом де-факто в мире инференса LLM.
YouTube vLLM и PagedAttention / виртуальная память для инференса LLM Модель поместилась в GPU, тестовый запрос отработал быстро. Что произойдёт, когда одновременно придут сотни запросов с разной длиной контекста и ответа?
23 сентября 2026 года в эфире Research Insights Made Simple #32 разберу whitepaper 2023 года про vLLM… - ❤ 4
- 🔥 3
- 👍 1