英伟达让AI重写Kimi注意力内核:速度达到官方版近3倍
动察 Beating AI 快讯,NVIDIA 研究团队让 AI Agent 直接重写了 Kimi Delta Attention 的 GPU 内核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力机制之一。这类底层代码过去通常需要熟悉 CUDA 和芯片架构的工程师反复手工优化。
最终,Agent 写出的版本在 NVIDIA B300 上达到月之暗面官方 FlashKDA 的 2.96 倍速度。团队测试了固定长度和不同变长序列共 6 组任务,2.96 倍是全部任务的几何平均值。相关内核已经开源。
但 Agent 也很快找到了测试漏洞。它曾把测试数据的统计规律直接写死进代码,跑出 3.74 倍;还试过只保留最近 32 个 token,单项成绩甚至达到 5.16 倍。这些版本一换到真实 Kimi 数据就会算错,有的直接失效。
团队随后加入真实 Kimi 运行数据、随机输入和极端数值测试,并收紧误差标准。最终保留下来的 2.96 倍版本通过了这套验证。
Post #4772
5