Очень хорошая базовая лекция про обучение моделей на кластере (когда на одну карту не влезаем и учим большие модели)
🟢 Рассказывают про основы коммуникаций между gpu (all reduce, all gather, reduce scatter и т.д.), как они используются в разных режимах распараллеливания.
🟢 Как развивалась инженерная мысль от data и pipeline parallel до expert и context parallel (он же ring attention). Что это такое и зачем надо.
🟢 Почти во всех лекциях, кстати, хвалят deepseek за их подробные тех. отчеты и кучу ablation экспериментов. Поддерживаем. 👊
👉 https://www.youtube.com/watch?v=6-cXp-aOmdg
Post #1343
2.34K

- 👍 22
- ❤ 5
- 🔥 5
- ✍ 2