TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #90 1.28K
LLM арена - худший бенчмарк

Думаю многие из вас слышали про то что, openai "хакнули" арену, обучив gpt4o-mini на диалогах оттуда, завысив ее результат (хотя это вроде как онлайн метрика и такого быть не должно). По итогу модель заняла 2ое место, обойдя топовые модели от claude, хотя сама не может отличить минуты от секунд!
До этого все форсили высокие результаты маленькой лламы-8б, обвиняя арену в том, что там задают какие то "не те" вопросы (слишком простые)
К тому же часто есть вопросы к системным промптам, а так же к квантизациям моделей, так как иногда они выдают полнейшую чушь, что не воспроизводится локально.
Так же в арене есть очень сильный баес на маленькие и быстрые модели, а так же на короткие ответы, так как люди часто даже не дожидаются долгого ответа более умной модели)

Но следует понимать что результат ЕЛО - показывает лишь то, какая генерация больше нравится юзерам, которые пользуются ареной, на тех вопросах что они задают, в интерфейсе разделенном на 2 чата, ...%тут долгое описание условий эксперимента%

Если взять других людей, другую скорость генерации, другие вопросы и задачу для ллм, другие системные промпты да даже другой интерфейс - результаты могут сильно поплыть)

И тут дело не в том, что арнеа плохо сделаный бенчмарк, просто полученые скоры моделей могут сильно не корелировать с вашим ощущением "качества" моделей, а так же с результатами в ваших задачах.

Таким образом, что бы понять какую претрейн LLM лучше использовать именно в вашей задаче - считайте онлайн метрики именно на ней:
* если делаете rag-техподдержку - смотрте число удачных ответов и перехода на оператора
* code copilot - на число комплишнов
* генерация промо материалов - на качество полученной рекламы
и так далее

P.S. Разумеется арена это хороший способ отделить "в целом" хорошие модели от "в целом" плохих", но это не значит что нужно надрачиваться на ело рейтинга в ней )
  • ❤ 5
  • 👍 3
More from @mlphys
  1. Oct 1, 2026Это конец подписочных B2C бизнесов - Openai dot сама сканит почту - Поняла что есть подпис…
  2. Sep 29, 2026Тлдр сегодняшнего dev day open ai За те же лимиты надо будет платить 500 баксов Не тратьте…
  3. Sep 29, 20266.1 sol все таки выходит
  4. Sep 29, 2026Dots - новая система от openai, always on ai Живёт в приложении на телефоне и компьютере,…
  5. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  6. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →