Как ускорить ML-модель в продакшене и почему скорость инференса напрямую влияет на деньги, пользователей и инфраструктурные затраты бизнеса?
Рассказывает на YouTube, в ВК и ДЗЕН Александр Дубейковский (ML-Engineer Авито, ex-Yandex, эксперт MLinside) и показывает на практических примерах, почему модели «летают» в ноутбуке, но тормозят в реальных системах, и какие инженерные решения действительно дают прирост производительности.
Квантование, прунинг, дистилляция, батчинг, кэширование, аппаратное ускорение и ONNX – вы поймёте, как и когда применять каждый подход, какие компромиссы между скоростью и точностью неизбежны и как не потерять качество на критичных кейсах. Видео будет особенно полезно тем, кто хочет перейти от академического ML к реальным бизнес-системам и научиться делать модели быстрыми, экономичными и ценными для продукта.
Если вы еще не смотрели, собрали для вас ссылки:
YouTube
ВК
Дзен
Post #419
2.11K
- ❤ 9
- ⚡ 6
- 🔥 4