Обычный inference запускает десятки отдельных GPU kernels: QKV, attention, MoE, RMSNorm и другие. Между ними GPU постоянно ждёт синхронизацию и новые kernel launches.
Cohere объединила весь decode step в один persistent megakernel.
На North Mini Code:
- 292 tok/s при batch size 1
- против 185 tok/s у vLLM
- использование теоретического bandwidth H100 выросло с 39% до 62%
- ускорение сохраняется вплоть до 256K context
- без измеримой потери качества
Откуда выигрыш:
меньше kernel launches → меньше глобальных barriers → лучше загрузка SM → prefetch весов → меньше простаивающего GPUПричём это уже не лабораторный benchmark: система поддерживает continuous batching, paged attention, ragged sequences, tool calling и OpenAI-compatible API.
Сам megakernel написан в одном CUDA-файле — без отдельного compiler stack.
https://cohere.com/blog/megakernels