Это может быть интересно: похоже популярный ИИ-бенчмарк LMArena отдаёт преимущество именно крупным компаниям
Новое исследование от учёных Cohere Labs, MIT, Stanford и других институтов выявило, что LMArena — ведущий краудсорсинговый бенчмарк для оценки ИИ-моделей — создаёт несправедливые преимущества для технологических гигантов, что может искажать его широко известные рейтинги. 🧐
📊 Ключевые выводы исследования:
• Такие компании как Meta, Google и OpenAI тайно тестируют множество вариантов своих моделей на платформе, публикуя только лучшие результаты
• Модели от крупных лабораторий получают больше внимания: на Google и OpenAI приходится более 60% всех взаимодействий на платформе
• Доступ к данным Arena значительно повышает производительность моделей именно в задачах этой платформы, что указывает на переобучение, а не на реальное улучшение возможностей
• 205 моделей были тихо удалены с платформы, причём модели с открытым исходным кодом удаляются чаще других
💡 Почему это важно:
LMArena оспаривает выводы исследования, утверждая, что их рейтинг отражает реальные предпочтения пользователей. Однако подобные заявления могут серьезно подорвать доверие к платформе, которая формирует общественное восприятие ИИ-моделей.
В сочетании с недавним скандалом вокруг бенчмарка Llama 4 Maverick, это исследование подчеркивает важный факт: оценка ИИ-систем не всегда так объективна, как кажется на первый взгляд.
А вы доверяете популярным ИИ-бенчмаркам? Делитесь мнением в комментариях! 👇
#ИскусственныйИнтеллект #ИИ_исследования #LMArena #технологии
Post #142
267

- ❤ 3
- 👍 1