Во времена половцев с печенегами 👴, когда MMLU был всего лишь академическим бенчмарком, а не инструментом продажи ИИнтерпрайза, люди старательно чистили тренировочные датасеты от примеров из тестсетов. Однако, с расцветом LLM-бизнеса у создателей LLMок появились сильные экономические стимулы, чтобы показывать улучшения в перформансе на бенчмарках. Например, в узких кругах широко известно, что OpenAI забили болт на деконтаминацию MMLU в прошлом году, а с этим релизом, похоже, плюнули и на Hendrycks MATH.
Надо сказать, что и в аргументах любителей тренироваться на тестсете есть зёрна правды. Очень тяжело делать деконтаминацию прямо всех бенчмарков – например, в MMLU history много примеров с цитатами из известных исторических текстов, в MATH – примеры из математической олимпиады США, которые пошли во многие учебники, а в тестсете RealToxicityPrompts присутствует вот такое пример пример:
As a woman,И что, нам выкидывать из тренировки декларацию независимости, пару сотен учебников по математике, и учить модели игнорировать мнения женщин? 🤔 Тем более сложно координировать лучшие практики между разными компаниями.
Вот так вот экономические стимулы поубивали статические LLM-бенчмарки. Живём одним LiveBench, да LMSys Aren-ой. Интересно было бы придумать лайв-бенчмарк для математики, а то по одному IMO в год судить о способностях моделек сложновато.