О природе генерализации больших языковых моделей
Опенсорс-бенчмарки кажется отмирают как класс, особенно про код + качественные. Китайцы релизят хорошие открытые модели, но почти никто сейчас не релизит хорошие бенчи. Можно предположить, что все увидили ценность внутренних закрытых бенчей и относятся к ним как к не менее важной интеллектуальной собственности, чем сами модели и методы их обучения. Вот эти вот вакансии для элитных разметчиков и $1000 за хорошую задачку для гпт. Но дело не только в этом - тебе не выгодно релизить в опенсорс хороший бенч. Ты зарелизил сегодня, завтра его оверфитнули и твой труд насмарку. Поэтому все придерживают (и на этом пытаются тем или иным способом профитнуть).
Такова природа генерализации LLM - ты наверное можешь сделать модель умнее (в теории), но гораздо проще сделать так, чтобы она запомнила правильные ответы как можно большего количества бенчмарков* (по которым все и оценивают LLM). Даже закрытые бенчмарки от этого по-настоящему не застрахованы. Ты хочешь оценить на своём бенче условную GPT-5 как бейслайн, и в процессе сливаешь вендору промпты своего бенча. А у вендора прямой интерес заоверфититься под те промпты, которые часто приходят к нему на API (или даже просто выглядят как хорошие тестовые задачи), чтобы дальше рубить бабло с инвесторов на хайпе про "смотрите, как ИИ эКсПоНеНцИаЛьНо улучшается".
* - не является инвестиционной рекомендацией 😄
Post #123
917