Проблема, которую закрывает проект, знакома всем, кто выкатывал ML-нагрузки в k8s: один под забирает целый ускоритель, утилизация 10-20%, а очередь на GPU растёт. HAMi позволяет «нарезать» физический GPU или NPU на доли с жёсткой изоляцией по вычислениям и памяти, размещая несколько контейнеров на одной карте.
HAMi — это инструмент, который позволяет выжать максимум из железа без переписывания кода приложений и изменения манифестов Kubernetes.
Архитектурно это device plugin плюс несколько компонентов. Mutating Webhook перехватывает создание подов и переписывает запросы ресурсов. Scheduler Extender фильтрует ноды и раскладывает поды по политикам размещения. Device Plugins регистрируют ускорители и выдают их доли контейнерам. HAMi-Core — слой виртуализации, который держит жёсткие лимиты. HAMi-WebUI даёт интерфейс управления и метрики в Prometheus и Grafana.
Для платформенной команды это перевод дорогого железа из режима «одна карта - одна задача» в нормальный SLO по утилизации, без переписывания приложений и без vendor lock-in на конкретный стек.
В планах команды : продвинутый шедулинг, поддержка DRA и расширение списка ускорителей. Для тех, кто выбирает базу под inference-платформу на 2026-2027, это уже кандидат для PoC рядом с NVIDIA GPU Operator и MIG.
@DevOpsKaz 😛
