Gateway API Inference Extension — расширение для маршрутизации трафика, созданное для GenAI и LLM, работающих на Kubernetes. Оно превращает обычные шлюзы в мощные инструменты для инференса, решая задачи вроде задержек и перегрузок GPU.
⚪️ Умная маршрутизация с учётом моделей и критичности запросов
⚪️ Снижение задержек (до 400–500 QPS) и оптимизация для саморазвёрнутых AI
⚪️ Поддержка GPU/CPU и масштабирование с HPA
👉 Посмотреть репо
Идеально для тех, кто хостит LLM на кластерах.
Кстати, если вашим AI-проектам нужна стабильная, отказоустойчивая и высокоэффективная инфраструктура, — welcome в Сore 24/7. Организуем все, что необходимо, от идеи до результата. Консультация — бесплатно.
@DevOpsKaz 😛
