Step 5 Preview — 600 млрд параметров и ставка на долгоживущих агентов
Китайская StepFun представила Step 5 Preview — новую флагманскую модель, которую компания проектировала прежде всего для реальных агентных задач: программирования, разработки ПО, исследований, работы с финансами и других сценариев, где модели нужно долго работать с большим контекстом, вызывать инструменты и самостоятельно выполнять цепочки действий. Step 5 построена на разреженной MoE-архитектуре: всего в ней 600 млрд параметров, но на каждый токен активируются только 27 млрд. Контекстное окно достигает 1 млн токенов, модель принимает текст и изображения. API и StepFun Studio уже открыты, а веса компания обещает опубликовать 15 октября.
В независимом Artificial Analysis модель получила 44 балла в Intelligence Index. Там же измерили скорость примерно в 100 выходных токенов в секунду и цены в $1 за миллион входных и $2,70 за миллион выходных токенов. StepFun делает именно сочетание качества и стоимости центральной частью релиза и называет Step 5 новым шагом на «границе Парето»: идеей в том, что улучшить соотношение интеллекта, скорости и цены одновременно становится всё сложнее.
По официальным тестам Step 5 Preview набрала 93,5% на GPQA Diamond, 85% на Terminal-Bench v2.1, 88,7% на BrowseComp и 76% на MMMU-Pro. Особенно StepFun выделяет агентные и профессиональные задачи: 29,5% на компьютерном ALE-CLI, 66,4% на финансовом FrontierFinance и 83,3% на тесте глубокого исследования DRACO. При этом картина не везде одинаковая: например, на более сложном Terminal-Bench v4 модель получила 33,3%, заметно уступив GPT-6 Astra и Claude Opus 5. Часть опубликованных StepFun тестов, включая StepCodeBench и FinStepBench, разработаны самой компанией, поэтому их результаты разумнее воспринимать как предварительные до независимого воспроизведения.
Самая интересная часть анонса связана не с короткими бенчмарками, а с экспериментами на многочасовых задачах. StepFun дала модели до 24 часов на автономную оптимизацию GPU-ядер: агент самостоятельно менял код, запускал тесты, сравнивал результаты и продолжал итерации. Примерно через 22 часа производительность оптимизированного MLA-ядра достигла 508 TFLOPS против 493 TFLOPS у Claude Opus 5 в эксперименте StepFun. В другом 24-часовом опыте Step 5 самостоятельно проектировала данные для постобучения Qwen3-30B-A3B и подняла результат модели на AIME 2024 с 53,3% до 60%.
Таким образом, Step 5 Preview интересна не столько очередным увеличением числа параметров, сколько инженерной комбинацией из очень разреженной MoE, миллионного контекста и обучения под продолжительную агентную работу. Если результаты многочасовых экспериментов подтвердятся после выхода весов и независимых тестов, это будет ещё одним признаком смещения конкуренции между крупными моделями от «кто лучше отвечает на запрос» к «кто способен часами самостоятельно выполнять настоящую работу».
Post #1330
219
- ❤ 2