FlashKDA — реализация KDA на базе CUTLASS, заточенная под современные GPU NVIDIA.
По бенчмаркам разработчиков:
• H20: ускорение примерно до 2,31× относительно
chunk_kda• GB200: до 3,27× на variable-length sequences
• поддерживается batching последовательностей разной длины
• интеграция уже есть в flash-linear-attention ≥ 0.5.0 — FlashKDA может автоматически выбираться как backend
Требования пока серьёзные: SM90+, CUDA 12.9+ и PyTorch 2.4+.
Интересно здесь другое: вместе с моделями Moonshot постепенно открывает и низкоуровневый стек, необходимый для быстрого запуска их архитектур.
🔗 https://github.com/MoonshotAI/FlashKDA
