Если все пять передовых моделей ответят на ваш вопрос неверно, то его могут включить в пул, а авторов вознаградят - авторы TOP-50 вопросов получат по $5000, TOP-500 получат по $500. Часть вопросов оставят в качестве "проверочных" для будущего детекта LLM.
За прошедшее время, набор финализированных 2500 вопросов превратился в самый жёсткий бенчмарк для AI - Humanity's Last Exam (HLE, последний экзамен человечества).
Прорывная (и безумно дорогая) на тот момент o1 от OpenAI набирала всего 8% правильных ответов.
С того момента прошло 10 месяцев, до вчерашнего дня модели дошли до 21.6% (Google Gemini 2.5 Pro) и 20.3% (OpenAI o3) правильных ответов, что само по себе невероятный результат за такой срок.
Но вчера xAI (компания Илона Маска) релизнули Grok 4 и она набирает на этом бенчмаркес максимальным компьютом (Grok 4 Heavy) и с доступом к доп.инструментам (всякие калькуляторы, питоны и т.д.) модель выдаёт 44,4% (50.7% на текстовой части) и 25.4% без него!
К сожалению, лучше всего модель себя показывает именно на тексте - мультимодальностью пока что поступились ради текста. Обещают это поправить в следующем обновлении базовой модели.
Если эти бенчмарки правдивы (жду независимых тестов), то новая топовая модель на этот раз от Илона Маска.
Да, возможно она будет круто решать задачи и параллельно оправдывать Гитлера, но так уж выходит, если тренировать её на нефильтрованном твиттере и 4chan, а что вы хотели.
Доступна в платной подписке на grok.com за $30\$300 в месяц
Доступна и по API за $3 ($6) \ $15 ($30) за миллион входных\выходных токенов за 128к (128к+) токенов контекста.

