TGViewer
ML доставляет ML доставляет @ml_kuper · 784 subscribers
Post #377 489
⚡️ MLOps-платформа Купера: вопросы и ответы

MLOps-платформа растёт вместе с командами, моделями и инфраструктурой. А ещё регулярно подкидывает вопросы: что автоматизировать, что оставить командам, где поставить ограничения и как понять, куда её развивать.

В мини-интервью Юрий Классен, руководитель команды MLOps, рассказывает, как в Купер.тех развивают MLOps-платформу и что влияет на решения:

1️⃣ Как понять, что ML-платформа действительно помогает, а не просто добавляет ещё один слой абстракции?

Мы много этим вопросом задавались и задаемся до сих пор, особенно когда выбираем задачи, которые делать стоит, а какие нет. В нашей команде мы в первую очередь смотрим на обратную связь пользователей платформы: ML-инженеров и разработчиков.
Долгое время нашей основной целью было снижение Time to Market ML-проектов. Сейчас с помощью платформы мы также стараемся оптимизировать затраты на инфраструктуру. Кроме того, ML-платформа влияет на количество инцидентов и время их устранения, но этот элемент мы пока не оценивали в формате «до/после».


2️⃣ Что перестало работать по мере роста числа моделей и команд? Какие подходы пришлось пересмотреть?

Основное, что перестало работать, является даже не техническим решением, а форматом работы. У нас была модель поддержки, в которой инженеры MLOps-команды при возникновении каких-то проблем у ML-инженеров приходили разбираться в их технических решениях, не всегда даже связанных со взаимодействием с платформой. В таком формате небольшая MLOps-команда перестала справляться, поэтому мы постепенно перестроили поддержку: начали делать инструкции, проводить встречи, делиться опытом и интересными кейсами из поддержки. Теперь на основе этих материалов более опытные ML-инженеры могут помогать своим коллегам.


3️⃣ Есть ли у вас механизмы, которые помогают не сжечь весь кластер
одной моделью?


Стоимость ML-инфраструктуры для нас очень важна. Даже если фича даёт бизнес-эффект, важно понимать, не обходится ли она дороже, чем приносит пользы. В таком случае разрабатывать и внедрять её просто не имеет смысла. Поэтому мы стараемся не только ускорять работу ML-команд, но и помогать им оптимально использовать инфраструктурные ресурсы.

Чтобы одна модель не могла забрать на себя весь кластер, мы разделяем ноды по критичности нагрузки, используем requests и limits в Kubernetes и контролируем, сколько ресурсов запрашивается под разные задачи. Для GPU-нагрузок используем MIG. Он помогает эффективнее делить GPU между задачами и снижает риск, что они будут мешать друг другу.


4️⃣ Есть ли сценарии, где задержка в несколько сотен миллисекунд уже становится критичной?

Обычно это сценарии, напрямую связанные со взаимодействием с пользователем. Пользователь заметит, если результаты поиска или рекомендации загружаются слишком долго, и, конечно, это влияет на удовлетворённость клиентов. Поэтому, когда мы делаем решения для таких систем, на latency смотрим очень внимательно. Например, у меня даже был доклад о том, как мы оптимизировали этот показатель в нашем Feature Store. С ним можно ознакомиться по ссылке.
  • 😎 5
  • 👏 2
More from @ml_kuper
  1. Sep 16, 2026#ивент #спикер ecom.tech на karpov.courses Когда: 16 сентября, 19:00 Формат: online Доклад…
  2. Jul 30, 2026✨Хороший work-life balance сам себя не настроит В ML много задач, где мозг постоянно что-т…
  3. Jul 15, 2026🔥uvидел, установил, победил Есть вещи, которые в Python-разработке объединяют всех: любов…
  4. Jul 3, 2026💬 От интуиции к алгоритму: как мы научились управлять массовым привлечением курьеров 9 ию…
  5. Jun 11, 2026📦 Как с помощью ML-моделей посчитать, сколько человек нужно для доставки? Если курьеров и…
  6. Jun 3, 2026🌍 LLM-платформа звучит красиво, пока её не надо поддерживать 4 июня на Infra.conf’26 в Мо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →