Мечтают ли нейросети об олимпиадах? 🪐
Многие математики любят соревнования за сложные задачи, дух соперничества и радость от найденного решения. Мы решили посмотреть, как с олимпиадными задачами справятся большие языковые модели. Так родилась рубрика CS Space Reasoning 🆕
Как это устроено 🔽
1️⃣ Берём настоящую олимпиаду, пока её условия не появились в открытом доступе и не попали в обучающие выборки моделей.
2️⃣ Передаём модели только текст задания. Без интернета, поиска, внешних инструментов и выполнения кода — как у участников олимпиады.
3️⃣ Решения читают организаторы и ставят балл по критериям исходной олимпиады. Каждую работу независимо проверяют несколько экспертов, а при расхождении оценок определяют итоговый балл по обсуждению.
4️⃣ Публикуем все результаты: итоговые баллы, полные тексты решений, количество использованных токенов и стоимость запуска каждой модели.
Первым соревнованием в рубрике стал Math Cup 2026: десять моделей решали задачи отборочного тура и финала. Результаты можете посмотреть на сайте, а пока несколько спойлеров:
⚡️ Искусственный интеллект газанул настолько, что сместил естественный с пьедестала
⚡️ Две модели набрали поровну, но одна обошлась в 15 раз дороже другой
⚡️ Одна задача оказалась не по силам ни одному виду интеллекта
⚡️ Kimi K3, о которой у нас почти не говорят, мечтает так, что заехала на пьедестал рядом с GPT и Claude!
⚡️ А GigaChat и Alice AI, похоже, пока видят другие сны — их место в таблице ищите сами!
Пользуйтесь бенчмарком, изучайте решения моделей и следите за новыми соревнованиями. А если знаете олимпиаду, которую стоит дать моделям следующей, — присылайте! Результаты, неожиданные решения и идеи для новых запусков обсуждаем в чате CS Space 🚀
Post #322
3.55K

- ❤ 28
- 🔥 18
- ⚡ 13