TGViewer
analyst_exe | инженерное мышление в IT analyst_exe | инженерное мышление в IT @analyst_exe · 507 subscribers
Post #710 103
14 моделей рисуют BPMN. Кто рабочая лошадь, а кто заставит зайца ждать?

Взял историю про Петра и зайца, подключил модели к MCP Stormbpmn и устроил 42 запуска: одинаковый промпт, по три попытки, новые сессии, без ручных подсказок. Прогон занял 1 час 54 минуты.

Внутри обнаружилась интересная инженерная деталь. Модели передают Storm эскиз на Mermaid с метками BPMN: где параллельный шлюз, где таймер, где ожидание события. Сервис превращает его в BPMN, а дальше модель может редактировать элементы и запрашивать автоматическую раскладку.

Знакомый язык для модели, специальные значения для сервиса. Даже конструкция :::класс уже есть в Mermaid — Storm использует её для обозначения BPMN-типов. Модели остаётся выбрать логику; писать весь BPMN XML и рассчитывать координаты ей не приходится. Так работали все 42 запуска.

Все диаграммы прошли техническую проверку. Но по условию Пётр ждёт зайца до восьми часов. Некоторые модели поставили таймер на восемь часов, а уже после него проверку: «Заяц пришёл?» Заяц может стоять рядом, Пётр всё равно ждёт.
Ещё ловушка: Пётр каждый час ищет перец, Зинаида со временем замечает повторения и помогает. Если сделать её помощь обязательной перед следующей проверкой, независимый цикл исчезает.

Astra — победитель строгой проверки: оба сценария и завершение поддержаны в 3/3 попыток. Медианное время — 224 секунды. Дорого богато и правильно.

Sonnet 5 — мой кандидат в рабочие лошади для черновиков: 58 секунд, правильное ожидание зайца в 3/3. Но Зинаиду упрощает во всех трёх. Этот участок придётся исправлять.

DeepSeek 4.1 Flash: 53 секунды, ожидание верно в 2/3. У GLM Flash тоже 2/3, у Haiku — 0/3. Sol — 3/3, но 245 секунд: медленнее Astra и с упрощением Зинаиды. Terra и Luna стабильного результата по ожиданию не дали.

Входных токенов за сеанс у Sonnet — медиана 153 тыс., у Astra — 709 тыс., у Sol — 1,54 млн. Сюда входит повторное чтение контекста из кэша. Без чтения кэша — 38,6 / 60,7 / 99,5 тыс. Разница уже скромнее. Это не прямая цена и не расход лимита подписки.

Пока выбираю Sonnet для черновика с ревью, Astra — когда нужна строгая логика этого кейса. Стоимость ручных правок ещё не измерена.

Один кейс, три повтора. Логику проверял ИИ, человеческая оценка впереди. Сравниваем модели вместе с их клиентами и интерфейсом Storm; способность самостоятельно генерировать BPMN XML здесь не проверяли.

А как справятся ещё более мелкие модели или — (крестимся) — российские модели?

🔥 И я пробую нарисовать тот же кейс через Гигачат и Алису

@analyst_exe
  • 🔥 9
  • ❤ 2
More from @analyst_exe
  1. Sep 21, 2026Ну это не дело, сами из резюме вытащить не могут? @analyst_exe
  2. Sep 20, 2026Есть идеи, чем я таким сижу занимаюсь? Пишите варианты в комментариях) @analyst_exe
  3. Sep 19, 2026В субботу отдыхаем честно украденным мемом @analyst_exe
  4. Sep 16, 2026Господа, расскажите в комментариях, что происходит с рынком труда нынче? Кто смотрел? Кто…
  5. Sep 14, 2026Все ясно, вам нужны только мемы Их есть у меня @analyst_exe
  6. Sep 14, 2026Помните сервис "Резюмешка"? Доработал и опубликовал на сайте https://analystexe.ru/service…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →