TGViewer
TechPublisher TechPublisher @techpublisher · 232 subscribers
Post #2928 8
TPU обогнал GPU на 57% в тесте с Kimi K3 — благодаря новому способу запуска модели
Продолжение поста

Дополнительно работает алгоритм ускорения вывода DSpark от DeepSeek: маленькая модель угадывает несколько токенов вперёд, большая — проверяет пачкой. В среднем 6 из угаданных токенов проходят проверку, что ускоряет генерацию без потери точности. Оценки модели на тестах GPQA-Diamond (94,4%) и GSM8K (97,2%) на TPU и GPU совпали.

Inferact основан в ноябре 2025 года командой, которая создала vLLM — самый распространённый движок для запуска больших языковых моделей с открытым кодом. CEO Simon Mo был основным мейнтейнером vLLM, сооснователь Woosuk Kwon — автором алгоритма PagedAttention, который решил проблему фрагментации памяти на GPU. В январе 2026 года компания привлекла $150 млн в рамках посевного раунда при оценке $800 млн; лид-инвесторы — a16z и Lightspeed.

Megakernel написан на Pallas — низкоуровневом языке программирования Google для TPU, аналоге CUDA для Nvidia. Стандартный компилятор XLA плохо справляется с оптимизацией на 92 слоя сразу, поэтому Inferact обошёл его и написал управление памятью вручную. Побочный эффект — время компиляции сократилось с 30+ минут до 90 секунд.

На чипах Qwen 3 разрыв оказался ещё больше: 4 чипа TPU v7 дали 1515 токенов в секунду против 695 на аналогичном числе GB200. Без режима ускоренного вывода, в тесте batch size = 1, TPU выдаёт 249 токенов/с против 127 у GB200.

Megakernel разработан совместно с Google Cloud с целью сделать TPU полноценно поддерживаемой платформой в vLLM. Код опубликован в открытом доступе в репозитории tpu-megakernels. Сейчас реализация заточена под архитектуру Kimi K3; Inferact планирует расширить поддержку на другие модели.

Источник: QbitAI (🇨🇳)

#Google #Inferact #DeepSeek #TPUv7 #vLLM #ускорение #вывод
More from @techpublisher
  1. Sep 29, 2026Утечек стало меньше, но данных утекло больше: финансы и малый бизнес под ударом Продолжени…
  2. Sep 29, 2026Утечек стало меньше, но данных утекло больше: финансы и малый бизнес под ударом По данным…
  3. Sep 29, 2026Китайская Yimu Tech решила проблему тактильных ощущений у роботов с помощью света Продолже…
  4. Sep 29, 2026Китайская Yimu Tech решила проблему тактильных ощущений у роботов с помощью света Роботы у…
  5. Sep 29, 2026Анонимная модель Space Bunny возглавила рейтинги OpenRouter и OpenCode — что это такое и к…
  6. Sep 29, 2026Анонимная модель Space Bunny возглавила рейтинги OpenRouter и OpenCode — что это такое и к…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →