⚪️ Долгожданные изменения для AI/ML-нагрузок
Группы взаимосвязанных подов теперь трактуются как единая сущность —
workload-aware preemption. Если один под из ML-задачи вытесняется, вся группа либо держится, либо уходит вместе. Больше не будет ситуации, когда половина distributed training job висит без ресурсов и жжёт деньги.Группу подов теперь можно разместить внутри одного топологического домена, заданного общим лейблом. Критично для задач, где латентность между нодами влияет на время обучения.
⚪️ DRA продолжает взрослеть
Из новых alpha-фич: видимость доступности ресурсов через
ResourcePoolStatusRequest — наконец можно узнать, сколько GPU свободно, без парсинга ResourceClaims по всем неймспейсам. Плюс поддержка списков атрибутов: драйвер теперь может описать устройство с несколькими PCIe-корнями, а не только скалярными значениями.⚪️ Schedulability по CSI — важно для stateful
Новая фича запрещает шедулинг пода на ноды, где нет нужного CSI-драйвера. Ни одна stateful-нагрузка не попадёт на ноду, которая не сможет примонтировать нужный том.
⚪️ HPA наконец умеет масштабировать до нуля
Фича
HPAScaleToZero, которая ждала своего часа с Kubernetes v1.16, в v1.36 включается по умолчанию. Staging и тестовые окружения теперь можно гасить полностью, без idle-подов.⚪️ Безопасность образов
Kubelet переходит на ephemeral-токены для аутентификации при pull-е образов вместо статических секретов — короткоживущие, автоматически ротируются, привязаны к identity пода.
Полный разбор 20 новых alpha-фич — у Palark
@DevOpsKaz 😛
