Андрей Бугаенко опубликовал на Хабре результаты трёх тестов, имитирующих реальные сценарии анализа (описания тестов есть в совсем кратком виде в статье, конечно, хорошо бы посмотреть на тестовые данные и промпты вживую, но автор их не выложит).
Результаты тестов очень даже согласуются с моим пользовательским опытом использования этих моделей для бизнес- и системной аналитики.
Единственное, я не использую "древние" БЯМ-ки (понятно, что смысла в этом нет, хотя результат с DeepSeek-R1 и DeepSeek-V3.2 удивляет).
Ну и дополнительный важный вывод:
если у вас нет возможности работать при помощи API или развёртывать модельки у себя, то используйте пока chatGPT-5.2.
#LLM #СА #BA
Post #324
485