TGViewer
Математика Дата саентиста Математика Дата саентиста @data_math · 14.3K subscribers
Post #736 2.96K
🧮 Модели решают математику… но не совсем

Исследователи предложили новый бенчмарк — MATH-Perturb, чтобы проверить: языковые модели действительно "умеют" решать задачи по математике или просто запоминают шаблоны?

📌 Что сделали: Они взяли 279 самых сложных задач из датасета MATH (уровень 5) и создали две версии для каждой:

MATH-P-Simple — простая пертурбация (вопрос формулируется иначе, но суть и метод решения не меняется).

MATH-P-Hard — сложная пертурбация (незаметное изменение, которое требует другого метода решения и более глубокого понимания).

🧠 Что показали тесты: Модели легко решают оригинальные и "простые" пертурбированные задачи — даже если используют "шорткат-решения" (по сути, угадывают по шаблону).
Но на сложных пертурбациях они резко проваливаются. Шорткат больше не работает, и модель теряется.

📊 Вывод: Многие языковые модели, включая самые продвинутые, не понимают математику в глубоком смысле. Они подбирают шаблон, а не рассуждают.

MATH-Perturb — отличный способ отделить память от мышления.

🔗 Подробнее: https://arxiv.org/abs/2404.01649
🔗 Бенчмарк: https://math-perturb.github.io/

@data_math
  • 👍 13
  • 🔥 4
  • ❤ 2
  • 👎 1
More from @data_math
  1. Sep 25, 2026💰 У пяти крупнейших гиперскейлеров уже $2,8 трлн будущих обязательств По данным Moody’s,…
  2. Sep 25, 2026Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀 🔸 Булат Шарипов расскажет, как в Авито…
  3. Sep 24, 2026arXiv получил $17,2 млн на следующие 3–5 лет. Деньги выделили Simons Foundation Internatio…
  4. Sep 23, 2026✔️ OpenAI расширила Academy до 14 курсов OpenAI добавила в свою образовательную платформу…
  5. Sep 23, 2026Почему универсального ML-алгоритма не существует? Теорема No Free Lunch утверждает: если у…
  6. Sep 22, 2026🚨 DeepSeek обучает модель на 2 трлн параметров и планирует следующую на 8 трлн Для сравне…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →