TGViewer
Anton Alekseev | Инфраструктура для AI и ML Anton Alekseev | Инфраструктура для AI и ML @mlops_infra · 1.06K subscribers
Post #114 1.58K
Алексеев_Млечныйпуть_Платформизация.pdf9.3 MB
Собрал ссылки по темам из моего доклада, чтобы можно было не только посмотреть презентацию, но и пойти дальше в детали.

А также запись выступления.

1. Три подхода к построению MLOps-платформы
Когда мы проектировали курс по MLOps для Яндекс Практикума, отдельно разобрали три варианта архитектуры MLOps-платформ на примерах известных западных компаний. Если хочется посмотреть на разные платформенные подходы не абстрактно, а через реальные архитектурные паттерны, начать можно отсюда.
https://habr.com/ru/companies/yandex_praktikum/articles/1014322/

2. Kubeflow: профили и enterprise-расширение
Если вам интересен multi-tenancy в Kubeflow, советую посмотреть, как устроены профили в Kubeflow, а затем заглянуть в пример enterprise-плагина для автоматического добавления профилей и интеграции с корпоративной моделью доступа.
Профили: https://www.kubeflow.org/docs/components/central-dash/profiles/
Пример IAM-плагина: https://github.com/kubeflow/kubeflow/blob/v1.10-branch/components/profile-controller/controllers/plugin_iam.go

3. Kueue
Мы используем Kueue как основной scheduler для AI workloads. Если вам интересны очереди задач, квоты, fair sharing и базовые принципы платформенного планирования ML-нагрузки в Kubernetes, здесь можно посмотреть основные концепции.
https://github.com/kubernetes-sigs/kueue
https://kueue.sigs.k8s.io/docs/concepts/

4. Istio Sidecar
Если вы используете Istio как service mesh, советую присмотреться к настройкам Sidecar. Это помогает сократить лишнюю нагрузку на Envoy и заметно экономить оперативную память.
https://istio.io/latest/docs/reference/config/networking/sidecar/

5. Распределённое обучение в Kubeflow
Если вы делаете distributed training в Kubeflow, рекомендую обратить внимание на trainer-operator. Это одна из базовых точек входа в платформенный слой для распределённого обучения.
https://github.com/kubeflow/trainer

6. Секреты и доступы
В этой статье хорошо разобраны варианты интеграции Kubernetes-кластера с корпоративным Vault, включая практическую сторону работы с секретами и доступами.
https://habr.com/ru/companies/oleg-bunin/articles/919234/

7. KServe и LLM inference
Если смотреть на то, как сегодня выглядит LLM inference в KServe, то вот хорошая точка входа в LLMInferenceService и текущую модель generative inference в платформе.
https://kserve.github.io/website/docs/model-serving/generative-inference/llmisvc/llmisvc-overview

8. Таймлайн про MLOps до 2035 года
И отдельно оставлю доклад с размышлениями о том, куда вообще движутся MLOps-платформы и почему со временем платформенный слой будет появляться практически везде.
https://www.youtube.com/watch?v=kWBpQZIGmik

Спасибо что слушали доклад! Вопросы можно задавать в комментариях)
  • 🔥 15
  • ❤ 1
More from @mlops_infra
  1. Jul 13, 2026Ну что, цель достигнута Всем аригато за активность) Посмотрим что там за бугром творится н…
  2. Jul 8, 2026Друзья, моя первая папочка 📂 в телеге, да еще и с такими классными каналами про инфрастру…
  3. Jul 7, 2026Всем привет! У моего товарища будет воркшоп про AI-агентов в разработке - будет полезно вс…
  4. Jun 29, 2026ML для больших компаний. Вышла моя статья про ML-платформу на Kubeflow. Это текстовый пере…
  5. Jun 23, 2026#mlinfra_digest Снова подборочка от моего разнорабочего. 1️⃣ Speculation Is All You Need �…
  6. Jun 17, 2026#mlinfra_digest Всем привет! Openclaw принес мне свежую порцию интересных статей про инфра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →