Какую LLM брать: пилим свой бенчмарк
Обычно выбор модели стартует с рейтингов. Только в этих таблицах ни черта не видно: потянет ли она твои задачи и в какую сумму это выльется — там не написано.
В лаборатории авторов есть электронный лабораторный журнал — по сути база, куда валятся данные всех экспериментов и измерений, а ИИ-ассистент по ней отвечает на вопросы. И встал вопрос: какую модель поставить рулить этим ассистентом? Публичные рейтинги внятного ответа не давали.
Пришлось пилить свой бенчмарк: 24 вопроса по собственной работе, прогнанные по живому журналу через MCP на DeepSeek, ChatGPT и Claude. В материале — как эти 24 вопроса родились, что на них показали девятнадцать комбинаций модели и уровня усилий при рассуждении (reasoning effort) примерно в 450 прогонах, и как собрать такой же тест под свою задачу.
Читать далее
👉 Telegram | Max
Post #5996
410
