TGViewer
maloy > talks maloy > talks @maloymediika · 1.13K subscribers
Post #216 426
Бенчмарки зло, и ты это знаешь!

Листал на днях ленту тг и зашел в канал к Пингвину и попался мне пост, где он говорил про новую модельку от клода - Соннет 5.5. И вот там он приложил документ с бенчмаркам, по цифрам вроде все хорошо, но я задумался над другим. А зачем вообще нужны бенчмарки? И тут я вспомнил про свою рубрику "История ИИ" и решил убить одним выстрелом двух зайцев: и пост для рубрики, и небольшой щитпост про бенчмарки.

Ну что ж, поехали:

Начнем как всегда с теории, разберем что такое бенчмарки, какие они бывают.

Конечно думаю многим и так это знают, но сказать надо. Бенчмарк - это тест, который проводят, сравнивая новую модель с прошлыми версиями/конкурентами на разных тестах.

Какие они бывают:

▪️ • Code

> HumanEval - модели даются простые задачки на Python

> SWE-bench Verified - даются проекты с багами/ошибками и тд, которые лежат на гите. Модель должна их найти и исправить. Багов около 500

> Terminal-Bench - модели дают изолированный компьютер с линуксом (привет саня гробовщик) и просят например: настроить сервер, что-то починить. Это проверка на то как хорошо модель может работать сама в терминале.

🥔 • Knowledge and reasoning

> GPQA Diamond - наисложнейшие задачи по физике, биологии, химии на уровне PhD (докторская степень). Суть в том, что загуглить такие задачи нельзя, тут уже нужно думать.

> MMLU - 16 тысяч вопросов по десяткам предметов с вариантами ответов. В этих вопросах есть все: от истории до терминов по медицине. Проверка на "кругозор"

> Humanity's Last Exam (HLE) - можно сказать "финальный" тест, потому что он собран из тысячи сложных вопросов от экспертов разных сфер со всего мира.

🫡 • Agents

> ARC-AGI - модели дают различные головоломки, которые ей надо решить. До конца что там проверяют я не понял, но нашел где можно почитать про ARC-AGI - тык.

> OSWorld - тест на то как модель пользуется комьютером. Ну типо Claude Cowork

Конечно тестов, которые проходит модель перед релизом намного больше, но я перечислил самые основные. Обычно их около 20, и это только те, которые выходят в свет.

📁📁▪️📁📁▪️📁📁▪️

С основами мы вроде разобрались, теперь я вам расскажу - почему бенчмарки это ху4ня?

1. Ненадежно - бенчи проводят внутри компаний, т.е они могут делать что хотят и угадать мы это не можем. Пару моментов, которые мы не контролируем:

> Количество попыток - у своей модели компания может посчитать лучший ответ, а от конкурентов взять первый. Конечно они будут отличаться.

> Модели, с которыми сравнивают - на бумаге может быть написано, что сравнивают "Claude sonnet 5 и Gemini Argon", но только в гемини поставить режим High, а в клоде Low. Ну вы поняли

2. Возможность врать - из первого пункта вытекает этот. Раз тесты проходят внутри компании, то и решать какие цифры будут они.

📁📁▪️📁📁▪️📁📁▪️

Бывало много случаев, когда компании врали, поэтому я склоняюсь к тому, что нужно проводить собственные тесты моделей. Если вам интересно почитать про то как и где можно проводить такое, то ставьте 25 реакций и пост летит к вам. А на сегодня все

Удачи!!


😴😴😴

Чат | Обменник | Все интервью | X School | AI-шоп
More from @maloymediika
  1. Oct 3, 2026Такого интервью ты еще не читал.. Поверь Всем привет, сегодня у меня в гостях - Василий Су…
  2. Sep 30, 2026Мы потратили на это целые сутки.. На что? А ты слушай дальше Позавчера пишет мне мой друк…
  3. Sep 25, 2026Если тебе меня мало… То эта подборочка для тебя - тыкни 😴😴😴 Чат | Обменник | Все интерв…
  4. Sep 25, 20265figs$ за неделю, как и на чем? Всем привет, сегодня в гостях у нас простой бородач, котор…
  5. Sep 23, 2026Нам стоит разобраться как обучать модельки, не думаешь? Вы набрали очень много реакций, по…
  6. Sep 21, 2026Вышел грок 4.7.... А не, вышло кое-что круче. Маленькая предистория: Ребята (райтер и айро…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →