TGViewer
Математика Дата саентиста Математика Дата саентиста @data_math · 14.3K subscribers
Post #954 3.59K
⚡️ DeepSeek, Gemini и GPT-5: кто лучше оценивает решения по математике

Команда исследователей проверила, как современные модели справляются с ролью «машинного экзаменатора» на задачах USAMO-2025. Результаты оказались довольно разнообразными.

Основные выводы:

- DeepSeek-Math V2 показала самую высокую точность и лучше всего совпала с оценками людей, когда в решении практически нет осмысленного прогресса.
- Gemini-3-Pro оказался лидером там, где в ответе есть частичное, но нетривиальное продвижение.
- GPT-5 продемонстрировал ровно сильное поведение в обоих сценариях.

Дополнительные результаты:

- DeepSeek-Math-V2 заняла первое место по точности и среднему абсолютному отклонению.
- GPT-5 стал лучшим по коэффициенту корреляции Пирсона.
- Gemini-3-Pro стабильно входит в топ-3 по трём метрикам.

Подробнее:
Блогhttps://gaussmath.ai/eval.html
Отчётhttps://gaussmath.ai/assets/eval.pdf
GitHubhttps://github.com/Gauss-Math/GAUSS-Eval
  • ❤ 2
  • 🥰 2
  • 👍 1
More from @data_math
  1. Sep 22, 2026🚨 DeepSeek обучает модель на 2 трлн параметров и планирует следующую на 8 трлн Для сравне…
  2. Sep 22, 2026Вопрос уже не в том, нужен ли ИИ, а в том, как его внедрять и масштабировать Найдем ответ…
  3. Sep 21, 2026OpenAI близка к решению ещё одной задачи тысячелетия — гипотезы Ходжа, сообщает The Inform…
  4. Sep 20, 2026VisualGenAI — курс по генеративным моделям в компьютерном зрении, который идёт в ногу с пе…
  5. Sep 18, 2026🧠 Одна формула, которая объясняет идею гомоморфизма: φ(a ∗ b) = φ(a) ∘ φ(b) Смысл простой…
  6. Sep 16, 2026📘 Бесплатная книга по выпуклой оптимизации Convex Optimization: Algorithms and Complexity…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →