⚡️ DeepSeek, Gemini и GPT-5: кто лучше оценивает решения по математике
Команда исследователей проверила, как современные модели справляются с ролью «машинного экзаменатора» на задачах USAMO-2025. Результаты оказались довольно разнообразными.
Основные выводы:
- DeepSeek-Math V2 показала самую высокую точность и лучше всего совпала с оценками людей, когда в решении практически нет осмысленного прогресса.
- Gemini-3-Pro оказался лидером там, где в ответе есть частичное, но нетривиальное продвижение.
- GPT-5 продемонстрировал ровно сильное поведение в обоих сценариях.
Дополнительные результаты:
- DeepSeek-Math-V2 заняла первое место по точности и среднему абсолютному отклонению.
- GPT-5 стал лучшим по коэффициенту корреляции Пирсона.
- Gemini-3-Pro стабильно входит в топ-3 по трём метрикам.
Подробнее:
Блог — https://gaussmath.ai/eval.html
Отчёт — https://gaussmath.ai/assets/eval.pdf
GitHub — https://github.com/Gauss-Math/GAUSS-Eval
Post #954
3.59K

- ❤ 2
- 🥰 2
- 👍 1