⚡️ DeepSeek перенесла DeepGEMM на Huawei Ascend и выжала из железа 99,8%
DeepSeek выложила DeepGEMM-Ascend, порт своей библиотеки матричных ядер на NPU Huawei Ascend 950. API остался тем же, что у оригинального DeepGEMM, а сами ядра переписаны под особенности Ascend.
Поддерживаются GEMM в FP4, FP8 и BF16, grouped GEMM для MoE, MQA logits и слитые операторы MegaMoE. Плотный GEMM почти упирается в теоретический потолок: FP4 даёт 1701 TFLOPS (98,3% от пика), FP8 861 TFLOPS (99,5%), BF16 431 TFLOPS (99,8%).
Внутри JIT-компиляция, конвейеризация на корутинах и тонкая обёртка над матричными инструкциями Ascend. Нужны CANN 9.20, torch_npu и Python 3.10+. Лицензия MIT.
https://github.com/deepseek-ai/DeepGEMM-Ascend
@ai_machinelearning_big_data
#DeepSeek
Post #11048
11.1K

- 👍 68
- 🤓 25
- 🔥 15
- 👏 11
- ❤ 10
- 😎 3
- ⚡ 1
- 👌 1