⚡️ PyTorch 2.14: NVGEMM, бэкенд nccl2 и отказоустойчивость внутри c10d
Вышел PyTorch 2.14 — 2 995 коммитов от 487 контрибьюторов. Главные темы: новый GEMM-бэкенд и распределённое обучение.
NVGEMM — бэкенд на CuTeDSL, который сам выбирает быстрейшее ядро для GEMM, с epilogue fusion и форматами вроде NVFP4 (только Blackwell). Включается через max_autotune_gemm_backends, требует nvidia-cutlass-dsl 4.6.0. nccl2 — новый in-tree бэкенд c10d из torchcomms: eager-only, one-sided RMA-окна, suspend/resume с offload памяти. Fault tolerance стала частью c10d: перенастройка process group без рестарта кластера, abort-хуки, Flight Recorder работает и с Gloo. В torch.compile — динамические формы через @dynamic_spec, torch.switch для MoE, compile-on-one-rank. На Apple Silicon Cholesky быстрее в 1.2–2.8x, lu_factor — более чем в 100x на мелких батчах. Overlap коммуникации и вычислений в Inductor включён по умолчанию.
Подвох: Python 3.15 поддержан только в eager, torch.compile бросает RuntimeError; ROCm 7.1 выброшен.
👉🏻 Канал | 💬 Чат | 📕 Каталог
Post #560
127