DeepSeek выжала из Huawei Ascend почти весь теоретический максимум
DeepSeek выложила DeepGEMM-Ascend — порт своей библиотеки матричных ядер под NPU Huawei Ascend 950.
API оставили таким же, как у оригинального DeepGEMM, но сами ядра переписали под особенности железа Ascend. То есть для разработчиков переход должен быть максимально безболезненным, а для чипа — максимально плотным по нагрузке.
Что поддерживается:
— GEMM в FP4, FP8 и BF16
— grouped GEMM для MoE
— MQA logits
— слитые операторы MegaMoE
По производительности цифры почти упираются в потолок:
— FP4: 1701 TFLOPS, или 98,3% от пика
— FP8: 861 TFLOPS, или 99,5%
— BF16: 431 TFLOPS, или 99,8%
Внутри — JIT-компиляция, конвейеризация на корутинах и тонкая обёртка над матричными инструкциями Ascend.
Для запуска нужны CANN 9.20, torch_npu и Python 3.10+. Лицензия — MIT.
GitHub:
https://github.com/deepseek-ai/DeepGEMM-Ascend
Post #5871
147
