В гайде про оптимизацию LLMок под TPU выпустили новую главу про.. GPU. 🤔
В основном разбираются отличия в скорости коммуникаций между чипами и как правильно шардировать модели для максимальной производительности. Примеры на наших с вами любимых ламах и дипсиках.
Последние пару недель занимаюсь такими оптимизациями под TPU на работе, ещё раз рекомендую – очень дидактичный материал.
Post #306
7.24K
epsilon correct Харкорные инженеры из гугла опубликовали гайд про то, как мы думаем про оптимизацию LLMок под TPU с глубоким разбором того, как всё работает под капотом. Рассказывают про шардирование параметров, тренировку, трюки инференса доступно и с диаграммами. 10/10…
- ❤ 25
- 🔥 21
- 👍 5