TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 534 subscribers
Post #1330 219
Step 5 Preview — 600 млрд параметров и ставка на долгоживущих агентов

Китайская StepFun представила Step 5 Preview — новую флагманскую модель, которую компания проектировала прежде всего для реальных агентных задач: программирования, разработки ПО, исследований, работы с финансами и других сценариев, где модели нужно долго работать с большим контекстом, вызывать инструменты и самостоятельно выполнять цепочки действий. Step 5 построена на разреженной MoE-архитектуре: всего в ней 600 млрд параметров, но на каждый токен активируются только 27 млрд. Контекстное окно достигает 1 млн токенов, модель принимает текст и изображения. API и StepFun Studio уже открыты, а веса компания обещает опубликовать 15 октября.

В независимом Artificial Analysis модель получила 44 балла в Intelligence Index. Там же измерили скорость примерно в 100 выходных токенов в секунду и цены в $1 за миллион входных и $2,70 за миллион выходных токенов. StepFun делает именно сочетание качества и стоимости центральной частью релиза и называет Step 5 новым шагом на «границе Парето»: идеей в том, что улучшить соотношение интеллекта, скорости и цены одновременно становится всё сложнее.

По официальным тестам Step 5 Preview набрала 93,5% на GPQA Diamond, 85% на Terminal-Bench v2.1, 88,7% на BrowseComp и 76% на MMMU-Pro. Особенно StepFun выделяет агентные и профессиональные задачи: 29,5% на компьютерном ALE-CLI, 66,4% на финансовом FrontierFinance и 83,3% на тесте глубокого исследования DRACO. При этом картина не везде одинаковая: например, на более сложном Terminal-Bench v4 модель получила 33,3%, заметно уступив GPT-6 Astra и Claude Opus 5. Часть опубликованных StepFun тестов, включая StepCodeBench и FinStepBench, разработаны самой компанией, поэтому их результаты разумнее воспринимать как предварительные до независимого воспроизведения.

Самая интересная часть анонса связана не с короткими бенчмарками, а с экспериментами на многочасовых задачах. StepFun дала модели до 24 часов на автономную оптимизацию GPU-ядер: агент самостоятельно менял код, запускал тесты, сравнивал результаты и продолжал итерации. Примерно через 22 часа производительность оптимизированного MLA-ядра достигла 508 TFLOPS против 493 TFLOPS у Claude Opus 5 в эксперименте StepFun. В другом 24-часовом опыте Step 5 самостоятельно проектировала данные для постобучения Qwen3-30B-A3B и подняла результат модели на AIME 2024 с 53,3% до 60%.

Таким образом, Step 5 Preview интересна не столько очередным увеличением числа параметров, сколько инженерной комбинацией из очень разреженной MoE, миллионного контекста и обучения под продолжительную агентную работу. Если результаты многочасовых экспериментов подтвердятся после выхода весов и независимых тестов, это будет ещё одним признаком смещения конкуренции между крупными моделями от «кто лучше отвечает на запрос» к «кто способен часами самостоятельно выполнять настоящую работу».
  • ❤ 2
More from @synaptic_garden
  1. Sep 21, 2026SpaceXAI представила Grok 4.7 — флагманскую модель, ориентированную на задачи программиров…
  2. Sep 21, 2026Появился сайт, на котором приведены ссылки на множество примеров использования Jev: https:…
  3. Sep 20, 2026Команда Qwen опубликовала веса Qwen-Image-2.1 — новой модели, которая объединяет генерацию…
  4. Sep 20, 2026PrismML ужала Qwen3.8 27B до 5,9 ГБ с трёхзначными весами PrismML выпустила Ternary Bonsai…
  5. Sep 20, 2026photo post
  6. Sep 19, 2026Бесплатный доступ к Jev через лист ожидания можно получить на сайте непосредственно вендор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →