Бенчмарк
В связи с приличной работоспособностью агента в 1С есть мысль сделать какой-то бенчмарк: для начала бенчмарк локальных моделей - как они справляются с агентскими бизнес-сценариями в конфигурации 1С.
Основной метрикой, видимо, будет, во-первых, дошел ли агент на этой модели в принципе до успешного выполнения запроса пользователя 😁.
А дальше уже можно будет посмотреть за сколько времени, сколько сжег токенов, процент успешности. Ну и так далее.
Тема так-то весьма актуальна, т.к. особо никто в бизнесе не рвется сливать свои базы 1С в OpenAI/Anthropic/Google и прочим китайцам. Половина готовы арендовать опенсорс модели в наших ЦОД, а вторая половина видят только локальное использование ИИ.
P.S. Грустно на скрине дипсику фреш в4
1С на диване
Post #228
309
