💦Из чего состоит ML-pipeline: 3 главных компонента
Если абстрагировать достижения современной ML-инженерии, то для построения эффективного конвейера машинного обучения нужны всего 3 основных инструмента:
• Хранилище фичей (Feature Store) для обработки офлайн- и онлайн-преобразований функций. Feature Store поддерживает контроль версий и должно быть интегрировано с озерами данных и КХД. Также оно должно обеспечивать возможность быстрого обслуживания фичей и оперативного развертывания кода в production. Примеры: Tecton, Hopsworks, Michelangelo Palette, Zipline, Feature Store от Amazon SageMaker и Databricks.
• Хранилище моделей (Model Store) в качестве центрального реестра моделей и отслеживания экспериментов. Оно обеспечивает воспроизводимость версий и отслеживание истории изменений каждой ML-модели, а также связанных артефактов, такие как Git коммиты, pickle-файлы, оценки, регрессия и пр. Примеры: Weights & Biases, MLFlow, Neptune.ai, EthicalML, а также решения от Amazon, Azure, Google.
• Хранилище оценок (Evaluation Store) для мониторинга и повышения производительности моделей. Оно обеспечивает выявление показателей производительности для каждой ML-модели в любой среде, от обучения до production, включая инструменты A/B тестирования и средства построения наглядных дэшбордов. Например, Arize и Neptune.ai.
Дополнительно будут полезны платформы аннотирования данных (Appen), обслуживания ML-моделей (Kubeflow, Algorithmia) и AI-оркестрации (Spell) для координации всех команд, участвующих в MLOps-процессах.
https://towardsdatascience.com/the-only-3-ml-tools-you-need-1aa750778d33
Post #66
181