TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2982 3.77K
⚡️ PyTorch 2.14 получил нормальную fault tolerance для distributed training

В больших distributed-задачах падение одного rank обычно означало неприятный сценарий: уничтожить process group, перезапустить его и потерять уже прогретое состояние по всему кластеру.

В PyTorch 2.14 fault tolerance становится частью c10d.

Теперь Backend и ProcessGroup получают API для reconfiguration in-place - группу можно перестраивать на месте, не снося весь distributed runtime целиком.

Что добавили:

- in-place reconfiguration для ProcessGroup;
- abort hooks;
- pre/post collective hooks;
- поддержку fault tolerance в Gloo вместе с nccl2;
- документированные API для reconfigure.

Это особенно важно для больших training jobs: чем больше кластер, тем дороже полный restart после одного сбоя.

Пока есть важная оговорка — в релизе API помечен как unstable, так что интерфейсы ещё могут меняться.

Подробнее:
https://pytorch.org/blog/pytorch-2-14-release-blog/
  • ❤ 11
  • 👍 6
  • 🔥 3
More from @machinelearning_interview
  1. Sep 21, 2026🔥 Hemmingway-1 - открытая модель, которая пытается писать как человек Модель построена на…
  2. Sep 20, 2026💰 Инвесторы допускают оценку Anthropic в $4 трлн после IPO, но дешёвые модели усиливают д…
  3. Sep 18, 2026photo post
  4. Sep 18, 202617 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создат…
  5. Sep 18, 2026🔐 GPT-6 Astra предложила расшифровку немецкой радиограммы 1918 года Автор эксперимента по…
  6. Sep 18, 2026Сегодня последний день регистрации на КосмоХакатон 18–20 сентября, Петербург, Красноярск и…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →