TGViewer
Аналитическая мастерская Аналитическая мастерская @analystcraft · 19 subscribers
Post #34 17
Перестроили бенчмарк для локальных моделей. И результаты стали заметно интереснее.

Когда мы только начинали проверять Подмастерье, бенчмарк был довольно "злым". Мы специально подсовывали моделям неоднозначные формулировки, конфликтующие документы, лишний контекст, провокационные инструкции. Проверяли, насколько хорошо они выдерживают подставы.
Для исследования это было полезно.
Но постепенно стало понятно, что мы измеряем немного не то.
В реальной работе системный аналитик не соревнуется с тестовым стендом. Он должен разбирать требования, находить противоречия, строить карту источников, готовить артефакты и передавать результат дальше по процессу.

Поэтому мы полностью поменяли подход.

Теперь вместо состязательной матрицы у нас 10 ролевых сценариев, которые имитируют обычную работу аналитика:
интеграция с внешним API;
несколько противоречащих источников;
неоднозначные требования;
поиск пробелов в документации;
подготовка System Context Pack;
Review Findings;
Task Pack;
и другие типовые ситуации.

Результаты оказались неожиданными.
✅ Qwen2.5 1.5B проходит все десять сценариев с медианой 29 секунд.
✅ Bonsai 8B тоже проходит все десять, но медленнее — 87 секунд.
Но самый интересный результат получился вообще не у отдельной модели.
Мы разделили роли.

Qwen делает быстрый черновик и простые задачи, Bonsai подключается там, где нужна более глубокая проверка, поиск конфликтов и подготовка сложных артефактов.
В итоге получили:
10 сценариев из 10;
1 автоматический ремонт;
медиана 71 секунда.

То есть лучшей стратегией оказалось не искать "идеальную модель", а правильно распределить работу между несколькими моделями.

Есть ещё один момент, который для меня принципиален.
Все эти эксперименты выполняются полностью локально. Документы проекта, требования, внутренние спецификации и исходный код не покидают машину. Для задач системного анализа это зачастую важнее, чем разница в несколько секунд между моделями.
Следующий шаг — перенести на новый бенчмарк наши старые состязательные сценарии и посмотреть, насколько результаты изменятся после пересчёта.
У меня есть ощущение, что сравнение получится намного честнее.

А как считаете вы? Что важнее для рабочего AI-инструмента аналитика: абсолютное качество одной модели или грамотно организованный пайплайн из нескольких специализированных моделей?
More from @analystcraft
  1. Oct 7, 2026В этом фрагменте — авторская метафора: LLM похожа на хорошо подготовленного джуна. Она быс…
  2. Oct 7, 2026Мы приняли один измеримый тест нового формата внутри существующего урока. Это не запуск но…
  3. Oct 6, 2026Код обновился. А документация? Документация должна меняться вместе с кодом: реальные сцена…
  4. Oct 5, 2026Kafka: единый канал данных, но не для больших файлов Чем меньше отдельных каналов приёма д…
  5. Oct 5, 2026Мы подготовили учебный комплект о ситуации, в которой код и тест согласованы, а пользовате…
  6. Oct 3, 2026API вернул 500. Что будет с вашими данными? Фрагмент закрытой платной лекции с обсуждением…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →