DevOps-инструмент недели: BentoML
Модель обучена, но сможете ли вы развернуть её, не создавая весь serving layer самостоятельно? Deployment модели обычно требует создания API, управления dependencies, а также мониторинга latency и ошибок.
Здесь и пригодится BentoML — open-source Python framework для serving AI-моделей. Вы определяете, как должна запускаться модель, а BentoML предоставляет инструменты для её serving, упаковки и последующего deployment.
Что умеет:
• Создавать API вокруг модели буквально несколькими строками Python-кода
• Работать с vLLM, Transformers, PyTorch, TensorFlow и XGBoost
• Использовать adaptive batching, объединяя requests для более эффективного использования CPU/GPU
• Упаковывать код, model assets и конфигурацию dependencies в Bento, а затем собирать из него Docker image для deployment
• Отслеживать request latency, traffic и errors с помощью встроенных metrics и server logs. Также поддерживается OpenTelemetry tracing
Для managed deployment и autoscaling есть BentoCloud, который автоматически масштабирует сервис в зависимости от нагрузки.
https://github.com/bentoml/BentoML
@SysAdmin_Portal
Post #1262
1.05K

- 🤝 2