2. Все модели стали примерно одинаково хороши.
Настолько одинаково, что сложно понять, какая лучше. Андрей Карпати написал, что у нас кризис оценки моделей: Уже непонятно, на какие метрики смотреть. MMLU устарел, SWE-Bench слишком узкий. Chatbot Arena настолько популярна, что лаборатории уже научились её "хакать".
https://x.com/karpathy/status/1896266683301659068
Про что он?
Сейчас есть несколько способов оценивать модели:
1 - Бенчмарки, которые измеряют что то одно конкретное и узконаправленное.
Например, умение писать код на питоне или уровень галлюцинаций в ответах. Но модели становятся умнее, осваивают всё больше задач, и одной метрикой их уровень уже не измеришь.
2 - Системные бенчмарки, которые пытаются кучей чиселок обсчитать модель с разных сторон.
Но когда начинаешь сравнивать кучу показателей, получается полный хаос. А бенчмарков десятки уже! Одна модель лучше в одном, другая — в другом, и не понятно как это интрепретировать.
3 - Арена, где люди вслепую сравнивают ответы моделей по своим субьективным критериям.
https://lmarena.ai/?leaderboard
И вместо непонятной кучи оценок, каждая модель получает ELO-рейтинг, как в шахматах. Чаще выигрываешь — выше эло. Но это было круто и удобно, пока модели не подобрались слишком близко друг к другу.
Разница в 35 ELO значит что у одной модели шанс дать ответ лучше 55%, а у другой 45%. Как и в шахматах, у игрока с меньшим ELO всегда есть шансы выиграть. Даже при разнице в 100 ELO треть ответов "худшей" модели будет лучше.
Ну то есть опять — одни задачи лучше решает одна модель, другие другая. Выбирай модель выше в списке и один из 10 твоих запросов будет получше. Какой и насколько лучше — хз.
Post #51
701
- 👍 5