TGViewer
IT Does Matter IT Does Matter @comol_it_does_matter · 4.65K subscribers
Post #1976 1.72K
Ну и да, кстати, вот так влияют MCP и правила на результаты бенча. Пока только Composer все задачки проверил. Но тем не менее уже "Круче Fable". Из максимальных 170. Модель достаточно плохо справляется с архитектурой и дизайном и MCP тут не помогут, поэтому оценки не везде максимальные. Надеюсь автономные агенты мне завершат уже бенч и я поделюсь результатами для всех моделей, хотя они вполне предсказуемы...
Но что стоит отметить - для Composer 2.5 расход токенов вырос (он относительно небольшой). Для более прожорливых моделей очень надеюсь что сократим...
Можно конечно утверждать, что "бенчмарк от вендора". Но вцелом все результаты перепроверяемы и это можно сделать. Может только MCP у меня чуть более поздней версии чем опубликованы, но существенно не повлияет.
  • 🔥 18
  • 👍 4
  • ❤ 2
More from @comol_it_does_matter
  1. Oct 7, 2026Итак, почему оно так развивается. Для чего эти все decision модели придумали? Да тут всё п…
  2. Oct 6, 2026Давайте немного поясню в очередной раз про "расход токенов на первый вызов". Прекратите уж…
  3. Oct 6, 2026Всем кто поюзал Pi и DSH для 1С огромное спасибо. Очень тщательно и внимательно вычленял в…
  4. Oct 6, 2026Ну очень интересная картинка: 👉 Стоимость подписки в пересчете на API 👉 Сравнение Anthro…
  5. Oct 6, 2026❗️❗️❗️❗️ ОСТОРОЖНО МОШЕННИКИ ❗️❗️❗️❗️ Коллеги, я никому не пишу ничего в личку тем более о…
  6. Oct 6, 2026Уловили же все веяния с Jev\clef\Julia? https://typesafe.ai/blog/introducing-system-one-mo…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →