Взял историю про Петра и зайца, подключил модели к MCP Stormbpmn и устроил 42 запуска: одинаковый промпт, по три попытки, новые сессии, без ручных подсказок. Прогон занял 1 час 54 минуты.
Внутри обнаружилась интересная инженерная деталь. Модели передают Storm эскиз на Mermaid с метками BPMN: где параллельный шлюз, где таймер, где ожидание события. Сервис превращает его в BPMN, а дальше модель может редактировать элементы и запрашивать автоматическую раскладку.
Знакомый язык для модели, специальные значения для сервиса. Даже конструкция
:::класс уже есть в Mermaid — Storm использует её для обозначения BPMN-типов. Модели остаётся выбрать логику; писать весь BPMN XML и рассчитывать координаты ей не приходится. Так работали все 42 запуска.Все диаграммы прошли техническую проверку. Но по условию Пётр ждёт зайца до восьми часов. Некоторые модели поставили таймер на восемь часов, а уже после него проверку: «Заяц пришёл?» Заяц может стоять рядом, Пётр всё равно ждёт.
Ещё ловушка: Пётр каждый час ищет перец, Зинаида со временем замечает повторения и помогает. Если сделать её помощь обязательной перед следующей проверкой, независимый цикл исчезает.
Astra — победитель строгой проверки: оба сценария и завершение поддержаны в 3/3 попыток. Медианное время — 224 секунды. Дорого богато и правильно.
Sonnet 5 — мой кандидат в рабочие лошади для черновиков: 58 секунд, правильное ожидание зайца в 3/3. Но Зинаиду упрощает во всех трёх. Этот участок придётся исправлять.
DeepSeek 4.1 Flash: 53 секунды, ожидание верно в 2/3. У GLM Flash тоже 2/3, у Haiku — 0/3. Sol — 3/3, но 245 секунд: медленнее Astra и с упрощением Зинаиды. Terra и Luna стабильного результата по ожиданию не дали.
Входных токенов за сеанс у Sonnet — медиана 153 тыс., у Astra — 709 тыс., у Sol — 1,54 млн. Сюда входит повторное чтение контекста из кэша. Без чтения кэша — 38,6 / 60,7 / 99,5 тыс. Разница уже скромнее. Это не прямая цена и не расход лимита подписки.
Пока выбираю Sonnet для черновика с ревью, Astra — когда нужна строгая логика этого кейса. Стоимость ручных правок ещё не измерена.
Один кейс, три повтора. Логику проверял ИИ, человеческая оценка впереди. Сравниваем модели вместе с их клиентами и интерфейсом Storm; способность самостоятельно генерировать BPMN XML здесь не проверяли.
А как справятся ещё более мелкие модели или — (крестимся) — российские модели?
🔥 И я пробую нарисовать тот же кейс через Гигачат и Алису
@analyst_exe


