https://vibecoding1c.ru/bench - полностью обновился Бенчмарк моделей для разработки на 1С:
✔️ Кто хотел видеть примеры того что модель разрабатывает - Welcome. Теперь не просто куски кода, а достаточно сложные задачи
✔️ Уровень задач в несколько раз сложнее чем в предыдущем. Период "сортировок пузырьком" явно закончен. 10-ок очень мало и в основном у самых новых моделей они.
✔️ Теперь есть задачи, которые проверяют планирование архитектуры, оптимизацию, работу в нагруженной системе, нестандартные подходы, дизайн, "знание" механизмов 1С
✔️ В бенч добавлено количество токенов на каждую задачу и стоимость токенов у модели
✔️ Включены все модели хоть как то достойные внимания, включая все последние модели конечно.
✔️ В решениях задач теперь бывают файлы - внешние обработки и скрины форм.
Основные выводы:
👉 По качеству Антропиков пока никто не догнал
👉 Среди китайцев GLM 5.2 без вариантов. Ну и вцелом я бы внимательно присмотрелся именно к этой модели как к "рабочей лошадке"
👉 DeepSeek - прошлый лидер, не выдерживает никакой конкуренции в агентских сценариях. Модель хорошо показывает себя в простом кодинге, но не в решении комплексных задач
👉 Очень рекомендую посмотреть теперь сами решения. Выбирать только одну модель для работы уже весьма странно.
📝 Пока в бенче тестирование "голых моделей". В реале так мало кто работает. Добавлю в бенч ещё результаты с MCP и правилами
📝 Ещё будут в каком либо виде результаты с разным reasoning эффектом
P.S. вряд ли конечно я ещё раз такой "подвиг" на такое количество токенов повторю. Так что лайки, репосты, шары приветствуются, как и решения "наконец то бросить кодить руками и прикупить MCP/курс" если ещё этого не сделали :).
Post #1929
2.03K

- 🔥 79
- 👍 17
- ❤ 7