🚀 Оптимизированные GPU ядра для LLM
TileKernels предлагает высокопроизводительные GPU ядра, разработанные с использованием TileLang. Проект фокусируется на эффективных операциях для больших языковых моделей, включая маршрутизацию экспертов и квантование, что позволяет достигать максимальной производительности оборудования.
🚀 Основные моменты:
- Высокая производительность для операций LLM
- Поддержка маршрутизации Mixture of Experts
- Квантование с различными форматами
- Удобные высокоуровневые обертки для PyTorch
- Активное улучшение качества кода и документации
📌 GitHub: https://github.com/deepseek-ai/TileKernels
#python
Post #2733
4.83K