YaLM 100B
Предварительно обученная языковая модель с 100 млрд. параметрами
YaLM 100B - это GPT-подобная нейронная сеть для генерации и обработки текста. Она может свободно использоваться разработчиками и исследователями со всего мира.
Модель использует 100 миллиардов параметров. Обучение модели заняло 65 дней на кластере из 800 видеокарт A100 и 1,7 ТБ онлайн-текстов, книг и бесчисленных других источников на английском и русском языках.
Подробности обучения и лучшие практики по ускорению и стабилизации можно найти в статьях на Medium (на английском) и Хабре (на русском).
Мы использовали DeepSpeed для обучения модели и черпали вдохновение в примере Megatron-LM. Однако код в этом репозитории - это не тот код, который использовался для обучения модели. Это скорее стоковый пример из репозитория DeepSpeed с минимальными изменениями, необходимыми для вывода нашей модели.
https://github.com/yandex/YaLM-100B
👉 @Githublib
Post #492
2.16K

- 👍 8