TGViewer
Data Science | Machinelearning [ru] Data Science | Machinelearning [ru] @devsp · 19.8K subscribers
Post #5996 410
Какую LLM брать: пилим свой бенчмарк

Обычно выбор модели стартует с рейтингов. Только в этих таблицах ни черта не видно: потянет ли она твои задачи и в какую сумму это выльется — там не написано.

В лаборатории авторов есть электронный лабораторный журнал — по сути база, куда валятся данные всех экспериментов и измерений, а ИИ-ассистент по ней отвечает на вопросы. И встал вопрос: какую модель поставить рулить этим ассистентом? Публичные рейтинги внятного ответа не давали.

Пришлось пилить свой бенчмарк: 24 вопроса по собственной работе, прогнанные по живому журналу через MCP на DeepSeek, ChatGPT и Claude. В материале — как эти 24 вопроса родились, что на них показали девятнадцать комбинаций модели и уровня усилий при рассуждении (reasoning effort) примерно в 450 прогонах, и как собрать такой же тест под свою задачу.

Читать далее

👉 Telegram | Max
More from @devsp
  1. Oct 2, 2026😅 Айтишник отправил в одну компанию три одинаковых резюме и только одно дошло до финала О…
  2. Oct 2, 2026🤣 Правильно расставленные приоритеты в моей жизни би лайк: 💥 xCode Journal
  3. Oct 1, 2026🤯 Люди взбунтовались против «пыточной для ИИ» На GitHub заметили открытый проект AI Tortu…
  4. Sep 30, 2026Две ИИ-фабрики в Армении: что там отгрохали и на кого это в итоге пашет В августе в Раздан…
  5. Sep 30, 2026Из Москвы в Миннеаполис — с тремя решениями для улучшения персонализации в рекомендательны…
  6. Sep 30, 2026Про Ember-1 сейчас гудят на Hacker News. Исследователи дообучили Kimi K3 так, что рассужда…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →