DeepGEMM — это высокопроизводительная библиотека, ускоряющая матричные вычисления для больших языковых моделей с использованием GPU NVIDIA.
Она объединяет ключевые вычислительные инструменты — включая операции с матрицами FP8 и FP4, системы экспертов (MoE) и оценку внимания — в одну эффективную кодовую базу CUDA.
🐱 GitHub
Post #10495
11.8K

- ❤ 14