TGViewer
Big Data Science [RU] Big Data Science [RU] @bdscience_ru · 1.62K subscribers
Post #579 801
😎💡Яндекс разработал и выложил в опенсорс библиотеку YaFSDP — собственное решение для ускорения обучения больших языковых моделей

YaFSDP — это собственная версия Яндекса для реализации подхода FSDP (от англ. Fully Sharded Data Parallel — параллелизм с полным разбиением данных. При этом YaFSDP лучше оптимизирует ресурсы графических процессоров на всех этапах обучения: pre-training (предварительное обучение), supervised fine-tuning (обучение с учителем), alignment (выравнивание модели). Благодаря этому библиотека стала использовать ровно столько памяти GPU, сколько нужно для обучения, а коммуникацию между графическими процессорами теперь ничто не замедляет.

На сегодняшний день это наиболее эффективный метод ускорения коммуникации между графическими процессорами (GPU), так как библиотека позволяет сократить до 25% время обучения языковых моделей (LLM) с открытым исходным кодом — результат зависит от архитектуры и числа параметров нейросети. При этом экономия ресурсов графических процессоров может достигать 20%.

YaFSDP оптимизирует загрузку вычислительных ресурсов графических процессоров (GPU). Библиотека лучше всего работает именно с большими моделями, поскольку их обучение требует и больших затрат вычислительных ресурсов.

Теперь YaFSDP могут применять сторонние компании, разработчики, исследователи и учёные как в России, так и в других странах, кто занимается обучением больших языковых моделей.

YaFSDP особенно пригодится тем, кто не может позволить себе использование мощных компьютерных систем и для тех, кто использует GPU в облаке. Например, это касается небольших стартапов и студенческих проектов.

Какую проблему решает YaFSDP?
Эта библиотека отлично подходит для решения проблемы "узкого горлышка", когда коммуникации между GPU существенно ограничивают скорость обучения модели независимо от скорости вычислений. Коммуникации между GPU при этом часто неэффективны, так как они используют не 100% мощностей. Следовательно, обучение LLM — это очень дорогой этап, а GPU везде сильно ограничены (особенно в РФ). Таким образом, YaFSDP позволяет значительно ускорить процесс обучения за счет оптимального использования ресурсов GPU.

Как итог, можно отметить ,что YaFSDP дает существенный выигрыш в производительности и потреблении памяти. Библиотека лучше всего подойдет для использования в текстовых генеративных моделях с архитектурой трансформера с несколькими слоями (многослойный перцептрон). Для претрейна (первого этапа обучения модели на ранее собранном большом наборе данных) модели в 70 миллиардов параметров, применение библиотеки позволит сэкономить ресурсы порядка 150 GPU.
GitHub GitHub - yandex/YaFSDP: YaFSDP: Yet another Fully Sharded Data Parallel YaFSDP: Yet another Fully Sharded Data Parallel. Contribute to yandex/YaFSDP development by creating an account on GitHub.
  • 👍 1
More from @bdscience_ru
  1. Sep 25, 2026Распознавание экрана (Onscreen Awareness) Siri научилась понимать, что происходит у вас на…
  2. Sep 15, 2026Reuters раскрыло инцидент со скоординированными действиями ИИ-агентов OpenAI: Расследовани…
  3. Aug 31, 2026Самая ужасная гавайская рубашка Немецкий дизайнер Симон Веккерт разработал гавайскую рубаш…
  4. Aug 25, 2026WeatherNext от Google DeepMind совершил прорыв в метеорологии! Новый ИИ прогнозирует тропи…
  5. Aug 15, 2026🧠 Enterprise AI наконец-то перестал быть «чатиком сбоку» OpenAI опубликовали два исследов…
  6. Aug 4, 2026Google двигает Gemini вниз по стеку - дешевле, быстрее, уже ближе к enterprise Google выпу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →