TGViewer
Трагедия общин 🤌 Трагедия общин 🤌 @commonstragedy · 652 subscribers
Post #51 701
2. Все модели стали примерно одинаково хороши.

Настолько одинаково, что сложно понять, какая лучше. Андрей Карпати написал, что у нас кризис оценки моделей: Уже непонятно, на какие метрики смотреть. MMLU устарел, SWE-Bench слишком узкий. Chatbot Arena настолько популярна, что лаборатории уже научились её "хакать".

https://x.com/karpathy/status/1896266683301659068

Про что он?

Сейчас есть несколько способов оценивать модели:

1 - Бенчмарки, которые измеряют что то одно конкретное и узконаправленное.

Например, умение писать код на питоне или уровень галлюцинаций в ответах. Но модели становятся умнее, осваивают всё больше задач, и одной метрикой их уровень уже не измеришь.

2 - Системные бенчмарки, которые пытаются кучей чиселок обсчитать модель с разных сторон.

Но когда начинаешь сравнивать кучу показателей, получается полный хаос. А бенчмарков десятки уже! Одна модель лучше в одном, другая — в другом, и не понятно как это интрепретировать.

3 - Арена, где люди вслепую сравнивают ответы моделей по своим субьективным критериям.

https://lmarena.ai/?leaderboard

И вместо непонятной кучи оценок, каждая модель получает ELO-рейтинг, как в шахматах. Чаще выигрываешь — выше эло. Но это было круто и удобно, пока модели не подобрались слишком близко друг к другу.

Разница в 35 ELO значит что у одной модели шанс дать ответ лучше 55%, а у другой 45%. Как и в шахматах, у игрока с меньшим ELO всегда есть шансы выиграть. Даже при разнице в 100 ELO треть ответов "худшей" модели будет лучше.

Ну то есть опять — одни задачи лучше решает одна модель, другие другая. Выбирай модель выше в списке и один из 10 твоих запросов будет получше. Какой и насколько лучше — хз.
  • 👍 5
More from @commonstragedy
  1. Sep 10, 20263. Это снова поднимает кучу вопросов о том как мы обучаем модели. В какой то момент место…
  2. Sep 10, 20262. Наличие системы оценки пушит к тому чтобы читерить Дальше случился другой факап с уже д…
  3. Sep 10, 2026Про скользкую дорожку Есть такой популярный аргумент, что нейросети это просто инструмент.…
  4. Aug 27, 2026Про диктовку голосом Потихоньку переучиваюсь наговаривать текст голосом, а не печатать на…
  5. Apr 14, 2026И чо? (последняя часть) Короче, индустрия не готова к росту от агентов. Потому что он случ…
  6. Apr 14, 20261. Больше всех железа у Google 2. На 2025 мы тратим 13 гигават энергии на вычисления 3. AS…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →