TGViewer
Математика Дата саентиста Математика Дата саентиста @data_math · 14.3K subscribers
Post #834 3.21K
🧠 StepFun‑Prover Preview: 32B‑модель обучилась доказывать теоремы, общаясь с Lean 4

📌 Что делает классический prover :
Он просто перебирает возможные доказательства, не зная, в каком направлении двигаться. Это как угадывать код на замке: пробуешь один вариант, не подошло — пробуешь следующий.

📌 Что делает новая модель StepFun‑Prover)
Она "разговаривает" с Lean 4 — проверяющей системой формальных доказательств. Если модель предлагает доказательство и Lean выдает предупреждение или ошибку, модель читает это как обратную связь и учится. В следующий раз она делает более точную попытку.

🧠 В итоге:

Вместо перебора 30+ вариантов вслепую, как у обычных систем, модель с первого раза решает до 70 % задач, потому что понимает и учитывает отклик от системы.

Это как решать задачу в школе, где тебе не просто говорят «неправильно», а объясняют, что именно не так — и ты быстро учишься.

🔍 Как это работает:
- Исходные задачи из Lean очищаются и превращаются в набор для обучения синтаксису и вызовам тактик.
- На этих данных обучаются 7B и 32B‑модели на базе DeepSeek, с последующей правкой ошибок Kimina‑Prover.
- Модель учится смешивать обычный текст, код на Lean и sandbox‑ответы — всё в одном длинном контексте.
- Вознаграждение бинарное: если Lean-программа принимает доказательство — 1, иначе — 0.

📈 Результат:
- 32B‑модель обходит конкурентов на 72B более чем на 5 % (при этом использует **1 попытку вместо 32**).
- Увеличение длины контекста с 4K до 20K токенов повышает pass@1 с 58 % до 70 %.
- Модель сокращает доказательства, читая варнинги и на лету рефакторя тактики.

📦 Open‑веса (7B и 32B) выйдут скоро — можно будет запускать даже на скромном GPU.

📄 Paper: https://arxiv.org/abs/2507.20199
  • ❤ 11
  • 🔥 3
  • 👍 2
More from @data_math
  1. Sep 25, 2026💰 У пяти крупнейших гиперскейлеров уже $2,8 трлн будущих обязательств По данным Moody’s,…
  2. Sep 25, 2026Avito DS Meetup: RL, AI-агенты и BidCorrection 🚀 🔸 Булат Шарипов расскажет, как в Авито…
  3. Sep 24, 2026arXiv получил $17,2 млн на следующие 3–5 лет. Деньги выделили Simons Foundation Internatio…
  4. Sep 23, 2026✔️ OpenAI расширила Academy до 14 курсов OpenAI добавила в свою образовательную платформу…
  5. Sep 23, 2026Почему универсального ML-алгоритма не существует? Теорема No Free Lunch утверждает: если у…
  6. Sep 22, 2026🚨 DeepSeek обучает модель на 2 трлн параметров и планирует следующую на 8 трлн Для сравне…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →