Ну и да, кстати, вот так влияют MCP и правила на результаты бенча. Пока только Composer все задачки проверил. Но тем не менее уже "Круче Fable". Из максимальных 170. Модель достаточно плохо справляется с архитектурой и дизайном и MCP тут не помогут, поэтому оценки не везде максимальные. Надеюсь автономные агенты мне завершат уже бенч и я поделюсь результатами для всех моделей, хотя они вполне предсказуемы...
Но что стоит отметить - для Composer 2.5 расход токенов вырос (он относительно небольшой). Для более прожорливых моделей очень надеюсь что сократим...
Можно конечно утверждать, что "бенчмарк от вендора". Но вцелом все результаты перепроверяемы и это можно сделать. Может только MCP у меня чуть более поздней версии чем опубликованы, но существенно не повлияет.
Post #1976
1.72K

- 🔥 18
- 👍 4
- ❤ 2