Humanity's Last Exam: самый сложный экзамен для ИИ
Сейчас в сети есть множество разных тестов и бенчмарков для иишек, но нейросети стали слишком умными — и решают их почти все на 80+ процентов.
Поэтому исследователи из CAIS и Scale AI создали Humanity’s Last Exam (HLE) — гигантский экзамен из 3 000 вопросов, покрывающий математику, естественные и гуманитарные науки. Там не только текстовые вопросы, есть и мультимодальные - с картинками и прочим.
Над ним работали ~1 000 экспертов из 500+ университетов по всему миру.
Цель — проверить, насколько LLM (ChatGPT, Claude, Gemini и тд) соответствуют экспертному человеческому уровню, а не просто проходят школьные тесты. Вопросы, конечно, в сети недоступны, они закрыты от внешнего доступа.
HLE — это не просто еще один бенчмарк, а попытка зафиксировать такую некую "экспертную границу", выше которой ИИ начнет реально заменять людей в интеллектуальных задачах
Приложил к посту в шапку результаты по разным моделькам: сейчас максимум, на что способны модели - это 18,8% решенных задач у Gemini-2.5 последней (несколько дней назад которую выпустили)
По прогнозам - до конца 2025 года ИИ смогут решить этот тест на 50%. Увидим 🙂
Официальный сайт бенчмарка
-------------------
😑 +1 в карму за лайк
❤️ @thats_it_ai_tech
#hle #бенчмарки
Post #164
683



- 🔥 10
- ❤ 5
- 👍 5