FAQ по бенчу:
❓Разница в токенах в 10-ки раз у моделей. Это нормально - топовые модели проводят "детальные исследования". Reasoning с Max Effort и его практически полное отсутствие это огромная разница. Также топовые модели пытаются "обновить базу любой ценой" - включая клики по картинкам, которые "стоят дорого", а если что то ещё не получается... Плюс тут без MCP - модель может "решить грепнуть всю базу" и получится лютый расход токенов. Который я мужественно оплатил, пустив слезу, но не подключая MCP во имя чистоты бенча.
❓Почему токены одной цифрой? Я знаю что есть Read/Write/Cache Read/Cache Write токены... Но добавлять полную статистику в бенч - отдельное его усложнение. Суммарную погоду не сделает. Входящий поток у всех задач одинаковый, правила если и есть - одинаковые. Суммарное количество токенов - хороший ориентир. Соотношение стоимости входящих и исходящих токенов примерно одного порядка у всех моделей. Количество токенов - хороший показатель как скорости так и стоимости решения задачи моделью. Для оценки сверху умножайте на стоимость исходящих.
❓Агент тестирования - Cursor (для большинства) и OpenCode (для DeepSeek, Qwen, Mimo, Minimax). Меньше агентов, чище бенчмарк. Systemprompt у Cursor очень приятный и "вылизаный".
❓Сам бенч занимает несколько суток и 😭😭😭 токенов/денег. Всё это безобразие оркестрирует hermes (всё таки автоадаптация скиллов и суммарная стабильность на такой долгой задаче лучше чем у краба), после гермес-а проверяет Олег, руками... 😭😭😭 на всякий случай, иногда коррректировки случаются. Если вам это ещё кажется фантастикой (вдруг) - вам сюда
❓ Напомню что оценка "5" в бенче это по сути очень плохо решенная задача. Поэтому результат ниже 85 означаяет что модель нельзя использовать для разработки на 1С (без MCP и правил точно).
❓Результаты также очень полезно смотреть чтобы узнать как та или иная модель пишет код. Они достаточно детальные.
❓Бенч на задачах 1С конечно может сильно отличаться от бенча на общих задачах или на классическом кодинге (фронт и бэк уже отличаются). Есть некоторая зависимость от базовых знаний обучающей выборки + разработка изобилует совмещением архитектуры с кодингом + правки "странных xml" и "сложные агентские сценарии". Для преемлимого уровня разработки на 1С конечно требования к моделям выше, + требования к моделям могут быть другие
❓Что такое преемлимый уровень? В бенче сложные задачи. Тем не менее, я бы в прод брал оценки от 7-8. Это от 119-136. (т.е. на Fable Max можно вменяемый 1С-ный код даже для сложных задач получить даже без MCP и правил). По субъективным ощущениям этот бенч выше 130 уже сопоставим с уверенным Senior разработчиком. Если освоили SDD, то уже пожалуй даже без деменции :).
Post #1930
1.65K
- ❤ 6
- 👍 5
- 🔥 4