TGViewer
Anton Alekseev | Инфраструктура для AI и ML Anton Alekseev | Инфраструктура для AI и ML @mlops_infra · 1.06K subscribers
Post #112 1.07K
Всем привет!

#mlinfra_digest

Пока смотрю свежие материалы по инфраструктуре для AI/ML, всё сильнее ощущение, что основная сложность уже давно не в том, как поднять модель, а в том, как потом всем этим нормально управлять в production.

1️⃣ Experimenting with GPUs: GKE managed DRANET and Inference Gateway AI Deployment
Хороший материал от Google про DRANET и inference gateway как отдельный слой платформы для AI-нагрузок.
Плюс inference gateway уже можно смотреть не только как идею из вендорских постов, но и как расширение Kubernetes Gateway API, которое уже хочется руками тестировать.
https://cloud.google.com/blog/topics/developers-practitioners/experimenting-with-gpus-gke-managed-dranet-and-inference-gateway-ai-deployment

https://github.com/kubernetes-sigs/gateway-api-inference-extension

2️⃣ Unlock efficient model deployment: Simplified Inference Operator setup on Amazon SageMaker HyperPod
У AWS понравился сам подход к inference operator. Если хочется писать свой оператор для inference platform, полезно посмотреть, как это разложено у них: lifecycle, rollout и platform-style управление serving-слоем. Особенно если KServe вам по каким-то причинам не подходит и хочется собирать более кастомный control plane.
https://aws.amazon.com/blogs/architecture/unlock-efficient-model-deployment-simplified-inference-operator-setup-on-amazon-sagemaker-hyperpod/

3️⃣ Overcoming inference challenges
У Red Hat понравилась простая и очень жизненная мысль: первый успешный ответ от модели это не победа, а только старт. Дальше начинается Day 2, где нужно разруливать hardware-model Tetris, latency/throughput trade-offs, стоимость и утилизацию GPU. И именно там быстро становится видно, есть ли у тебя inference platform, или пока просто набор YAML’ов.
https://www.redhat.com/en/blog/overcoming-inference-challenges
Google Cloud Blog Experimenting with GPUs: GKE managed DRANET and Inference Gateway AI Deployment | Google Cloud Blog Unleash next-level AI performance! Dive into the step-by-step guide for deploying the Deepseek LLM on GKE, harnessing managed DRANET, NVIDIA B200 GPUs, and the GKE Inference Gateway for lightning-fast, high-scale inference.
  • 🔥 2
  • ❤ 1
  • 👾 1
More from @mlops_infra
  1. Jul 13, 2026Ну что, цель достигнута Всем аригато за активность) Посмотрим что там за бугром творится н…
  2. Jul 8, 2026Друзья, моя первая папочка 📂 в телеге, да еще и с такими классными каналами про инфрастру…
  3. Jul 7, 2026Всем привет! У моего товарища будет воркшоп про AI-агентов в разработке - будет полезно вс…
  4. Jun 29, 2026ML для больших компаний. Вышла моя статья про ML-платформу на Kubeflow. Это текстовый пере…
  5. Jun 23, 2026#mlinfra_digest Снова подборочка от моего разнорабочего. 1️⃣ Speculation Is All You Need �…
  6. Jun 17, 2026#mlinfra_digest Всем привет! Openclaw принес мне свежую порцию интересных статей про инфра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →