Обещают 800 токенов в секунду (на одного юзера) против 150 у
При этом это все гоняется не на специализированных чипах Cerebras, а на какой-то обычной стойке из 8 B300.
В чем секрет такой выдающей скорости, не раскрывают, утверждают, что все дело в мегаэффективном движке инференса. По всей видимости основной фактор, определяющий latency, здесь - low-batch serving. И, само собой, удовольствие не дешевое, и чтобы не травмировать психику потенциальных юзеров, цену за мильон токенов не разглашают.
