#mlinfra_digest
Всем привет!
Openclaw принес мне свежую порцию интересных статей про инфраструктуру платформ, выделил наиболее актуальные.
1️⃣ Cloud native is now AI-native: Engineering production-ready AI
Cloud native трансформируется в AI native.
На первый план выходят отдельные primitives: DRA, Pod Groups / Workload API, Inference Gateway, плюс разговор уже идёт про AI Conformance и security для agentic flows.
А вы уже во всю тестируете переход на DRA? Или продовый куб отстает на 10 версий от апстрима?)
2️⃣ Scale On-Prem AI with Foundry Local on Azure Local: Multi-Node Inference and vLLM Support
Microsoft в Foundry Local на Azure Local добавили multi-node inference, vLLM runtime и planner, который сам подбирает memory-safe конфиг под модель и железо.
Меня здесь заинтересовал именно planner - как в azure подбирают параметры для vllm. Там еще отличная табличка какие параметры тюнить. Приложил к посту.
3️⃣ Reliable LLM Inference at Scale
У Databricks понравился акцент на том, что в проде проблема не в абстрактных benchmark’ах, а в том, как система ведёт себя под spiky demand.
Они пишут про:
• model-aware capacity planning,
• cost-aware routing,
• autoscaling по реальной стоимости нагрузки,
• recovery от silent failures и деградации latency.
4️⃣ How we achieved truly serverless GPUs
У Modal сильный инженерный разбор того, почему truly serverless GPUs — это сложно.
Ключевая проблема — startup latency, и решают они её через warm GPU buffers, lazy filesystem/image loading, checkpoint/restore и даже CUDA checkpoint/restore.
Я бы добавил еще тензерирование моделек, чтобы быстрее в GPU залетали и RDMA.
Post #120
1.46K