Собрал ссылки по темам из моего доклада, чтобы можно было не только посмотреть презентацию, но и пойти дальше в детали.
А также запись выступления.
1. Три подхода к построению MLOps-платформы
Когда мы проектировали курс по MLOps для Яндекс Практикума, отдельно разобрали три варианта архитектуры MLOps-платформ на примерах известных западных компаний. Если хочется посмотреть на разные платформенные подходы не абстрактно, а через реальные архитектурные паттерны, начать можно отсюда.
https://habr.com/ru/companies/yandex_praktikum/articles/1014322/
2. Kubeflow: профили и enterprise-расширение
Если вам интересен multi-tenancy в Kubeflow, советую посмотреть, как устроены профили в Kubeflow, а затем заглянуть в пример enterprise-плагина для автоматического добавления профилей и интеграции с корпоративной моделью доступа.
Профили: https://www.kubeflow.org/docs/components/central-dash/profiles/
Пример IAM-плагина: https://github.com/kubeflow/kubeflow/blob/v1.10-branch/components/profile-controller/controllers/plugin_iam.go
3. Kueue
Мы используем Kueue как основной scheduler для AI workloads. Если вам интересны очереди задач, квоты, fair sharing и базовые принципы платформенного планирования ML-нагрузки в Kubernetes, здесь можно посмотреть основные концепции.
https://github.com/kubernetes-sigs/kueue
https://kueue.sigs.k8s.io/docs/concepts/
4. Istio Sidecar
Если вы используете Istio как service mesh, советую присмотреться к настройкам Sidecar. Это помогает сократить лишнюю нагрузку на Envoy и заметно экономить оперативную память.
https://istio.io/latest/docs/reference/config/networking/sidecar/
5. Распределённое обучение в Kubeflow
Если вы делаете distributed training в Kubeflow, рекомендую обратить внимание на trainer-operator. Это одна из базовых точек входа в платформенный слой для распределённого обучения.
https://github.com/kubeflow/trainer
6. Секреты и доступы
В этой статье хорошо разобраны варианты интеграции Kubernetes-кластера с корпоративным Vault, включая практическую сторону работы с секретами и доступами.
https://habr.com/ru/companies/oleg-bunin/articles/919234/
7. KServe и LLM inference
Если смотреть на то, как сегодня выглядит LLM inference в KServe, то вот хорошая точка входа в LLMInferenceService и текущую модель generative inference в платформе.
https://kserve.github.io/website/docs/model-serving/generative-inference/llmisvc/llmisvc-overview
8. Таймлайн про MLOps до 2035 года
И отдельно оставлю доклад с размышлениями о том, куда вообще движутся MLOps-платформы и почему со временем платформенный слой будет появляться практически везде.
https://www.youtube.com/watch?v=kWBpQZIGmik
Спасибо что слушали доклад! Вопросы можно задавать в комментариях)
Post #114
1.58K