Мы собрали первый большой открытый бенчмарк работы LLM на 1C. В нем более 150 задач на написание кода в 1С. Бенчмарк имеет 2 режима — одношаговая генерация и многошаговый агентный режим для проверки работы AI агентов.
Подробности в статье на Хабре: https://habr.com/ru/companies/sberbank/articles/1040114
Сайт бенчмарка с результатами замеров на современных LLM: https://1cbench.github.io/
Репозиторий с кодом и задачами: https://github.com/1cbench/bench
Post #2099
266
Forwarded from Сергей Марков: машинное обучение, искусство и шитпостинг
- 🔥 2