TPU обогнал GPU на 57% в тесте с Kimi K3 — благодаря новому способу запуска модели
Продолжение поста
Дополнительно работает алгоритм ускорения вывода DSpark от DeepSeek: маленькая модель угадывает несколько токенов вперёд, большая — проверяет пачкой. В среднем 6 из угаданных токенов проходят проверку, что ускоряет генерацию без потери точности. Оценки модели на тестах GPQA-Diamond (94,4%) и GSM8K (97,2%) на TPU и GPU совпали.
Inferact основан в ноябре 2025 года командой, которая создала vLLM — самый распространённый движок для запуска больших языковых моделей с открытым кодом. CEO Simon Mo был основным мейнтейнером vLLM, сооснователь Woosuk Kwon — автором алгоритма PagedAttention, который решил проблему фрагментации памяти на GPU. В январе 2026 года компания привлекла $150 млн в рамках посевного раунда при оценке $800 млн; лид-инвесторы — a16z и Lightspeed.
Megakernel написан на Pallas — низкоуровневом языке программирования Google для TPU, аналоге CUDA для Nvidia. Стандартный компилятор XLA плохо справляется с оптимизацией на 92 слоя сразу, поэтому Inferact обошёл его и написал управление памятью вручную. Побочный эффект — время компиляции сократилось с 30+ минут до 90 секунд.
На чипах Qwen 3 разрыв оказался ещё больше: 4 чипа TPU v7 дали 1515 токенов в секунду против 695 на аналогичном числе GB200. Без режима ускоренного вывода, в тесте batch size = 1, TPU выдаёт 249 токенов/с против 127 у GB200.
Megakernel разработан совместно с Google Cloud с целью сделать TPU полноценно поддерживаемой платформой в vLLM. Код опубликован в открытом доступе в репозитории tpu-megakernels. Сейчас реализация заточена под архитектуру Kimi K3; Inferact планирует расширить поддержку на другие модели.
Источник: QbitAI (🇨🇳)
#Google #Inferact #DeepSeek #TPUv7 #vLLM #ускорение #вывод
Post #2928
8