TGViewer
Заметки LLM-энтузиаста Заметки LLM-энтузиаста @llm_notes · 1.01K subscribers
Post #142 267
Это может быть интересно: похоже популярный ИИ-бенчмарк LMArena отдаёт преимущество именно крупным компаниям

Новое исследование от учёных Cohere Labs, MIT, Stanford и других институтов выявило, что LMArena — ведущий краудсорсинговый бенчмарк для оценки ИИ-моделей — создаёт несправедливые преимущества для технологических гигантов, что может искажать его широко известные рейтинги. 🧐

📊 Ключевые выводы исследования:

• Такие компании как Meta, Google и OpenAI тайно тестируют множество вариантов своих моделей на платформе, публикуя только лучшие результаты

• Модели от крупных лабораторий получают больше внимания: на Google и OpenAI приходится более 60% всех взаимодействий на платформе

• Доступ к данным Arena значительно повышает производительность моделей именно в задачах этой платформы, что указывает на переобучение, а не на реальное улучшение возможностей

• 205 моделей были тихо удалены с платформы, причём модели с открытым исходным кодом удаляются чаще других

💡 Почему это важно:

LMArena оспаривает выводы исследования, утверждая, что их рейтинг отражает реальные предпочтения пользователей. Однако подобные заявления могут серьезно подорвать доверие к платформе, которая формирует общественное восприятие ИИ-моделей.

В сочетании с недавним скандалом вокруг бенчмарка Llama 4 Maverick, это исследование подчеркивает важный факт: оценка ИИ-систем не всегда так объективна, как кажется на первый взгляд.

А вы доверяете популярным ИИ-бенчмаркам? Делитесь мнением в комментариях! 👇

#ИскусственныйИнтеллект #ИИ_исследования #LMArena #технологии
  • ❤ 3
  • 👍 1
More from @llm_notes
  1. Sep 12, 2026Cronjob Response: Мониторинг анонсов reset от лидера Codex (job_id: 7a5e133998e4) --------…
  2. Sep 12, 2026Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сб…
  3. Aug 25, 2026Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра Завтра, 26 авг…
  4. Aug 25, 2026Grok Bot против Hermes Agent: два подхода к одной задаче Коллеги, добрый вечер! Скорее все…
  5. Jul 27, 2026Claude Opus 5: почти Fable за половину цены Коллеги, всем привет! 24 июля Anthropic выпуст…
  6. Jul 1, 2026🔓🚀 Возвращение Fable 5 и появление Sonnet 5 Anthropic за сутки закрыла историю с приоста…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →