Shared GPU — технология, которая позволяет использовать для запуска ML-модели ровно столько ресурсов GPU, сколько нужно для ее работы.
Это выгодно: арендовать часть видеокарты дешевле, чем целую, а еще можно перераспределять ресурсы в зависимости от нагрузки.
Эту технологию мы используем в сервисе Evolution ML Inference — тут вы можете запустить ML-модель в облаке. А в карточках рассказываем, как работает Shared GPU, и на реальных цифрах показываем экономию 👆




