Почему мы перешли на Kubeflow
У нас довольно долго не было единой ML-платформы, но сейчас мы к этому движемся — например, начали переводить всё больше процессов обучения моделей на Kubeflow. Саша Лагутин, тимлид команды ML-платформы расскажет, почему мы выбрали это решение и почему делаем свой форк.
Раньше большинство DS-команд работали на физических машинах: где-то использовалась связка Airflow+MLFlow, где-то просто ноутбуки.
Переход на Kubeflow дал много преимуществ:
➕ Не нужно толкаться на одной машине
➕ DS-инженерам не нужно погружаться в сложную инфру
➕ Мы стали лучше утилизировать дорогое железо
➕ Одна из киллер-фичей Kubeflow — lightweight-компоненты. Они позволили писать адхок-задачи прямо из локального Jupyter ноутбука, запуская их на Kubernetes.
Кроме этого у нас появился единый MLOps пайплайн:
➕ Эксперименты трекаются в одной базе вместе с пайплайнами
➕ Можно полностью отследить окружение, в котором был запущен эксперимент
➕ Все промежуточные и финальные артефакты логируются в S3
Чтобы Kubeflow стал удобнее и интегрировался с нашими системами, мы сделали свой форк. В нём прокинули LDAP, интеграцию секретов, интеграцию со Spark и Hadoop кластером, другими DWH системами, упростили интерфейс библиотеки kfp, где многое не нужно настраивать вручную. Также мы создали библиотеку компонент, которые переиспользуются внутри и между проектами — каждая команда может завести свой репозиторий.
На самом деле в ML-платформе есть ещё много, про что рассказать. Ждите новых постов от команды!
Post #14
1.22K

- 🔥 17
- ❤ 9
- 🤔 1