В июне мы уже рассказывали про Jalapeño, собственный чип OpenAI для инференса. Тогда готовых бенчмарков ещё не было, теперь компания опубликовала первые результаты.
На GPT-OSS, DeepSeek R1 и Kimi K2.5 чип выдаёт в 2,7–4,1 раза больше токенов в секунду на пользователя, чем NVIDIA GB200 и GB300 (самые мощные решения NVIDIA для запуска AI-моделей).
Если зафиксировать максимальную скорость NVIDIA для одного пользователя, разрыв по общей пропускной способности получается вообще аномальным: Jalapeño обрабатывает до 100 раз больше токенов на киловатт.
В абсолютной скорости генерации Cerebras пока впереди: Kimi K2.6 на их гигантском чипе выдаёт около 1000 ток/с, хотя напрямую сравнивать результаты нельзя из-за разных версий модели и методик тестирования.
@ai_for_devs
