TGViewer
IT Does Matter IT Does Matter @comol_it_does_matter · 4.65K subscribers
Post #1930 1.65K
FAQ по бенчу:

❓Разница в токенах в 10-ки раз у моделей. Это нормально - топовые модели проводят "детальные исследования". Reasoning с Max Effort и его практически полное отсутствие это огромная разница. Также топовые модели пытаются "обновить базу любой ценой" - включая клики по картинкам, которые "стоят дорого", а если что то ещё не получается... Плюс тут без MCP - модель может "решить грепнуть всю базу" и получится лютый расход токенов. Который я мужественно оплатил, пустив слезу, но не подключая MCP во имя чистоты бенча.

❓Почему токены одной цифрой? Я знаю что есть Read/Write/Cache Read/Cache Write токены... Но добавлять полную статистику в бенч - отдельное его усложнение. Суммарную погоду не сделает. Входящий поток у всех задач одинаковый, правила если и есть - одинаковые. Суммарное количество токенов - хороший ориентир. Соотношение стоимости входящих и исходящих токенов примерно одного порядка у всех моделей. Количество токенов - хороший показатель как скорости так и стоимости решения задачи моделью. Для оценки сверху умножайте на стоимость исходящих.

❓Агент тестирования - Cursor (для большинства) и OpenCode (для DeepSeek, Qwen, Mimo, Minimax). Меньше агентов, чище бенчмарк. Systemprompt у Cursor очень приятный и "вылизаный".

❓Сам бенч занимает несколько суток и 😭😭😭 токенов/денег. Всё это безобразие оркестрирует hermes (всё таки автоадаптация скиллов и суммарная стабильность на такой долгой задаче лучше чем у краба), после гермес-а проверяет Олег, руками... 😭😭😭 на всякий случай, иногда коррректировки случаются. Если вам это ещё кажется фантастикой (вдруг) - вам сюда

❓ Напомню что оценка "5" в бенче это по сути очень плохо решенная задача. Поэтому результат ниже 85 означаяет что модель нельзя использовать для разработки на 1С (без MCP и правил точно).

❓Результаты также очень полезно смотреть чтобы узнать как та или иная модель пишет код. Они достаточно детальные.

❓Бенч на задачах 1С конечно может сильно отличаться от бенча на общих задачах или на классическом кодинге (фронт и бэк уже отличаются). Есть некоторая зависимость от базовых знаний обучающей выборки + разработка изобилует совмещением архитектуры с кодингом + правки "странных xml" и "сложные агентские сценарии". Для преемлимого уровня разработки на 1С конечно требования к моделям выше, + требования к моделям могут быть другие

❓Что такое преемлимый уровень? В бенче сложные задачи. Тем не менее, я бы в прод брал оценки от 7-8. Это от 119-136. (т.е. на Fable Max можно вменяемый 1С-ный код даже для сложных задач получить даже без MCP и правил). По субъективным ощущениям этот бенч выше 130 уже сопоставим с уверенным Senior разработчиком. Если освоили SDD, то уже пожалуй даже без деменции :).
  • ❤ 6
  • 👍 5
  • 🔥 4
More from @comol_it_does_matter
  1. Oct 7, 2026Итак, почему оно так развивается. Для чего эти все decision модели придумали? Да тут всё п…
  2. Oct 6, 2026Давайте немного поясню в очередной раз про "расход токенов на первый вызов". Прекратите уж…
  3. Oct 6, 2026Всем кто поюзал Pi и DSH для 1С огромное спасибо. Очень тщательно и внимательно вычленял в…
  4. Oct 6, 2026Ну очень интересная картинка: 👉 Стоимость подписки в пересчете на API 👉 Сравнение Anthro…
  5. Oct 6, 2026❗️❗️❗️❗️ ОСТОРОЖНО МОШЕННИКИ ❗️❗️❗️❗️ Коллеги, я никому не пишу ничего в личку тем более о…
  6. Oct 6, 2026Уловили же все веяния с Jev\clef\Julia? https://typesafe.ai/blog/introducing-system-one-mo…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →