OpenAI заявила, что GPT-5.6 Sol запускается на чипах Cerebras со скоростью до 750 токенов в секунду.
Для понимания масштаба: современные флагманские LLM в реальном использовании обычно выдают десятки токенов в секунду. 750 токенов/с для общей модели — это прорыв на новый уровень.
Cerebras много лет пытается обойти NVIDIA другой архитектурой. У них wafer-scale chip — огромный чип почти размером с кремниевую пластину. Идея простая: не гонять данные туда-сюда между кучей отдельных ускорителей, а держать вычисления, память и пропускную способность максимально близко друг к другу. Меньше возни с передачей данных — меньше задержка — быстрее инференс.
До сих пор такие истории часто упирались в привычное «ну да, быстро, но на чем именно?». На маленькой модели? На специально удобном сценарии?
А тут OpenAI говорит не о какой-то игрушечной модели, а о Sol — верхнем уровне новой линейки.
Cerebras впервые выглядит не как красивая инженерная экзотика, а как реальная альтернатива GPU-инференсу для frontier моделей.
Пользователю, конечно, не станет дешевле. Цена Sol заявлена как $5 за миллион входных токенов и $30 за миллион выходных. Скорость сама по себе счет не уменьшает. Миллион токенов остается миллионом токенов — хоть вы сожгли его за минуту, хоть за десять секунд.
Но суть тут в другом: скорость и пропускная способность.
Для обычного чата это приятно, но не революция. Человек все равно не читает со скоростью 750 токенов в секунду. Зато для агентов это уже серьезно.
Агент не делает один большой запрос. Он работает циклами: подумал, вызвал инструмент, проверил результат, изменил план, снова подумал. Один вопрос пользователя легко превращается в десятки внутренних обращений к модели. В расследовании инцидента это логи, гипотезы, индикаторы, таймлайн, ложные версии и выводы.
Так что важно не то, что ChatGPT будет быстрее печатать текст. А что агент сможет выполнить больше внутренней работы до того, как человек вообще заметит задержку.
@gostev_future
Post #391
747
- 🔥 6
- 👍 2