😎💡Яндекс разработал и выложил в опенсорс библиотеку YaFSDP — собственное решение для ускорения обучения больших языковых моделей
YaFSDP — это собственная версия Яндекса для реализации подхода FSDP (от англ. Fully Sharded Data Parallel — параллелизм с полным разбиением данных. При этом YaFSDP лучше оптимизирует ресурсы графических процессоров на всех этапах обучения: pre-training (предварительное обучение), supervised fine-tuning (обучение с учителем), alignment (выравнивание модели). Благодаря этому библиотека стала использовать ровно столько памяти GPU, сколько нужно для обучения, а коммуникацию между графическими процессорами теперь ничто не замедляет.
На сегодняшний день это наиболее эффективный метод ускорения коммуникации между графическими процессорами (GPU), так как библиотека позволяет сократить до 25% время обучения языковых моделей (LLM) с открытым исходным кодом — результат зависит от архитектуры и числа параметров нейросети. При этом экономия ресурсов графических процессоров может достигать 20%.
YaFSDP оптимизирует загрузку вычислительных ресурсов графических процессоров (GPU). Библиотека лучше всего работает именно с большими моделями, поскольку их обучение требует и больших затрат вычислительных ресурсов.
Теперь YaFSDP могут применять сторонние компании, разработчики, исследователи и учёные как в России, так и в других странах, кто занимается обучением больших языковых моделей.
YaFSDP особенно пригодится тем, кто не может позволить себе использование мощных компьютерных систем и для тех, кто использует GPU в облаке. Например, это касается небольших стартапов и студенческих проектов.
Какую проблему решает YaFSDP?
Эта библиотека отлично подходит для решения проблемы "узкого горлышка", когда коммуникации между GPU существенно ограничивают скорость обучения модели независимо от скорости вычислений. Коммуникации между GPU при этом часто неэффективны, так как они используют не 100% мощностей. Следовательно, обучение LLM — это очень дорогой этап, а GPU везде сильно ограничены (особенно в РФ). Таким образом, YaFSDP позволяет значительно ускорить процесс обучения за счет оптимального использования ресурсов GPU.
Как итог, можно отметить ,что YaFSDP дает существенный выигрыш в производительности и потреблении памяти. Библиотека лучше всего подойдет для использования в текстовых генеративных моделях с архитектурой трансформера с несколькими слоями (многослойный перцептрон). Для претрейна (первого этапа обучения модели на ранее собранном большом наборе данных) модели в 70 миллиардов параметров, применение библиотеки позволит сэкономить ресурсы порядка 150 GPU.
Post #579
801