На фоне того, что Цукерберг скупает сотни H100 для обучения новых версий LLama, все остальные начинают страдать от нехватки high-end видеокарт.
А что делать бедным ресерчерам, у которых нет доступа к таким ресурсам?
Ну например, пробовать дообучать большие модели через децентрализацию, как делают в Petals.
Или, как предложили те же авторы Petals, обучать их, используя SWARM Parallelism.
Сегодня разбор именно этого подхода.
Ссылка на статью – SWARM Parallelism: Training Large Models Can Be Surprisingly Communication-Efficient
У автора этой статьи в том числе есть прекрасный курс под названием “Efficient Deep Learning Systems”, который я однозначно рекомендую всем, кто хочет погрузиться в DL с инженерной стороны. Есть и про менеджмент экспериментов, и про деплой на сервера/девайсы, и про профайлинг/мониторинг кода.
Post #18
1.59K