Перестроили бенчмарк для локальных моделей. И результаты стали заметно интереснее.
Когда мы только начинали проверять Подмастерье, бенчмарк был довольно "злым". Мы специально подсовывали моделям неоднозначные формулировки, конфликтующие документы, лишний контекст, провокационные инструкции. Проверяли, насколько хорошо они выдерживают подставы.
Для исследования это было полезно.
Но постепенно стало понятно, что мы измеряем немного не то.
В реальной работе системный аналитик не соревнуется с тестовым стендом. Он должен разбирать требования, находить противоречия, строить карту источников, готовить артефакты и передавать результат дальше по процессу.
Поэтому мы полностью поменяли подход.
Теперь вместо состязательной матрицы у нас 10 ролевых сценариев, которые имитируют обычную работу аналитика:
интеграция с внешним API;
несколько противоречащих источников;
неоднозначные требования;
поиск пробелов в документации;
подготовка System Context Pack;
Review Findings;
Task Pack;
и другие типовые ситуации.
Результаты оказались неожиданными.
✅ Qwen2.5 1.5B проходит все десять сценариев с медианой 29 секунд.
✅ Bonsai 8B тоже проходит все десять, но медленнее — 87 секунд.
Но самый интересный результат получился вообще не у отдельной модели.
Мы разделили роли.
Qwen делает быстрый черновик и простые задачи, Bonsai подключается там, где нужна более глубокая проверка, поиск конфликтов и подготовка сложных артефактов.
В итоге получили:
10 сценариев из 10;
1 автоматический ремонт;
медиана 71 секунда.
То есть лучшей стратегией оказалось не искать "идеальную модель", а правильно распределить работу между несколькими моделями.
Есть ещё один момент, который для меня принципиален.
Все эти эксперименты выполняются полностью локально. Документы проекта, требования, внутренние спецификации и исходный код не покидают машину. Для задач системного анализа это зачастую важнее, чем разница в несколько секунд между моделями.
Следующий шаг — перенести на новый бенчмарк наши старые состязательные сценарии и посмотреть, насколько результаты изменятся после пересчёта.
У меня есть ощущение, что сравнение получится намного честнее.
А как считаете вы? Что важнее для рабочего AI-инструмента аналитика: абсолютное качество одной модели или грамотно организованный пайплайн из нескольких специализированных моделей?
Post #34
17
