Бенчмарки зло, и ты это знаешь!
Листал на днях ленту тг и зашел в канал к Пингвину и попался мне пост, где он говорил про новую модельку от клода - Соннет 5.5. И вот там он приложил документ с бенчмаркам, по цифрам вроде все хорошо, но я задумался над другим. А зачем вообще нужны бенчмарки? И тут я вспомнил про свою рубрику "История ИИ" и решил убить одним выстрелом двух зайцев: и пост для рубрики, и небольшой щитпост про бенчмарки.
Ну что ж, поехали:
Начнем как всегда с теории, разберем что такое бенчмарки, какие они бывают.
Конечно думаю многим и так это знают, но сказать надо. Бенчмарк - это тест, который проводят, сравнивая новую модель с прошлыми версиями/конкурентами на разных тестах.
Какие они бывают:
▪️ • Code
> HumanEval - модели даются простые задачки на Python
> SWE-bench Verified - даются проекты с багами/ошибками и тд, которые лежат на гите. Модель должна их найти и исправить. Багов около 500
> Terminal-Bench - модели дают изолированный компьютер с линуксом (привет саня гробовщик) и просят например: настроить сервер, что-то починить. Это проверка на то как хорошо модель может работать сама в терминале.
🥔 • Knowledge and reasoning
> GPQA Diamond - наисложнейшие задачи по физике, биологии, химии на уровне PhD (докторская степень). Суть в том, что загуглить такие задачи нельзя, тут уже нужно думать.
> MMLU - 16 тысяч вопросов по десяткам предметов с вариантами ответов. В этих вопросах есть все: от истории до терминов по медицине. Проверка на "кругозор"
> Humanity's Last Exam (HLE) - можно сказать "финальный" тест, потому что он собран из тысячи сложных вопросов от экспертов разных сфер со всего мира.
🫡 • Agents
> ARC-AGI - модели дают различные головоломки, которые ей надо решить. До конца что там проверяют я не понял, но нашел где можно почитать про ARC-AGI - тык.
> OSWorld - тест на то как модель пользуется комьютером. Ну типо Claude Cowork
Конечно тестов, которые проходит модель перед релизом намного больше, но я перечислил самые основные. Обычно их около 20, и это только те, которые выходят в свет.
📁📁▪️📁📁▪️📁📁▪️
С основами мы вроде разобрались, теперь я вам расскажу - почему бенчмарки это ху4ня?
1. Ненадежно - бенчи проводят внутри компаний, т.е они могут делать что хотят и угадать мы это не можем. Пару моментов, которые мы не контролируем:
> Количество попыток - у своей модели компания может посчитать лучший ответ, а от конкурентов взять первый. Конечно они будут отличаться.
> Модели, с которыми сравнивают - на бумаге может быть написано, что сравнивают "Claude sonnet 5 и Gemini Argon", но только в гемини поставить режим High, а в клоде Low. Ну вы поняли
2. Возможность врать - из первого пункта вытекает этот. Раз тесты проходят внутри компании, то и решать какие цифры будут они.
📁📁▪️📁📁▪️📁📁▪️
Бывало много случаев, когда компании врали, поэтому я склоняюсь к тому, что нужно проводить собственные тесты моделей. Если вам интересно почитать про то как и где можно проводить такое, то ставьте 25 реакций и пост летит к вам. А на сегодня все
Удачи!!
😴😴😴
Чат | Обменник | Все интервью | X School | AI-шоп
Post #216
426
