TGViewer
Математика Дата саентиста Математика Дата саентиста @data_math · 14.3K subscribers
Post #811 3.11K
🧮 Результаты IMO‑2025 для LLM-моделей: кто решает задачи по-настоящему

MathArena опубликовала итоги тестирования LLM на задачах Международной математической олимпиады (IMO 2025) — самых сложных школьных задач, которых модели точно не видели в обучении.

📌 Что важно:
• Каждая модель решает каждую задачу 4 раза
• Баллы усредняются, чтобы сгладить "рандомность"
• Результаты не зависят от конкретного API — единая система оценивания
• Учитывается стоимость выполнения (в долларах)

🎯 Цель бенчмарка — честно сравнить способность моделей к рассуждению и обобщению на новых задачах, а не на выученных паттернах.

Ждём графики — интересно, кто справился лучше: GPT-4, Claude, Gemini или Mistral?
Следим за апдейтами от MathArena.

matharena.ai
  • ❤ 7
  • 👍 5
  • 🔥 2
More from @data_math
  1. Sep 26, 2026🎂 В комнате всего 35 человек и шанс совпадения дней рождения уже больше 80% Если случайно…
  2. Sep 26, 2026Многие компании уже запускают ИИ-проекты, но далеко не все доводят их до результата. Для э…
  3. Sep 26, 2026📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science р…
  4. Sep 25, 2026💰 У пяти крупнейших гиперскейлеров уже $2,8 трлн будущих обязательств По данным Moody’s,…
  5. Sep 25, 2026Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀 🔸 Булат Шарипов расскажет, как в Авито…
  6. Sep 24, 2026arXiv получил $17,2 млн на следующие 3–5 лет. Деньги выделили Simons Foundation Internatio…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →