Inference в Kubernetes
Всем привет!
Запуск LLM в Kubernetes. Отличается он чем-то от запуска LLM в иных средах? Если да, то чем? Какие могут быть нюансы?
Если вам интересны ответы на эти вопросы, то рекомендуем прочесть статью, в которой Автор разбирает этот вопрос.
Всё начинается с основ: как вообще формируется Inference? Кратко описываются этапы Tokenization, Prefill, Decode.
Получается, что нужно нечто, что загрузит модель, будет управлять памятью и запросами по мере их поступления. Так Автор плавно подходит к vLLM.
И дальше начинается самое интересное:
🍭 Подготовка кластера Kubernetes
🍭 Выбор модели, которая будет использоваться
🍭 Установка модели, конфигурация ресурсов Kubernetes
🍭 Небольшая настройка и использование
Каждый этап сопровождается комментариями и примерами. Но и это ещё не все!
После установки модели Автор развивает идею и настраивает взаимосвязь между Agentgateway и vLLM.
В итоге получилась отличная базовая статья, которая на простых примерах поясняет как и что работает.
А что ещё лучше – её вполне можно воспроизвести для собственных экспериментов ☺️
Post #1587
422