TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #42 996
Thor [2022]: комбинируем языковую модель и молотки

Программы и инструменты для доказательства теорем это отдельная вселенная, которую я за короткое время не смог полностью осознать. Я мучил вопросами ChatGPT, перечитывал статью кругами, и в итоге вроде бы смог немного понять суть.

Есть тут такая вещь, как hammer-ы - это название для "традиционных" методов поиска доказательств утверждения. Они работают, получая на вход утверждение в формализованном виде, и какой-то эвристикой находя его доказательство. Конечно же, возможности молотков сильно ограничены, но простые леммы доказывать умеет.

В то же время, есть система типа GPT-f. В статье утверждается, что успех GPT-f и hammer-ов плохо скоррелирован, потому что GPT-f плохо умеет находить факт, который нужно использовать, а hammer-ы плохи в длинных док-вах. Поэтому их нужно использовать вместе!

Делают это так же, как языковые модели учат использовать API: в датасет для файнтюна GPT-f интегрируют токен вызова <hammer>, который будет просить молоток доказать данное утверждение. Такой гибрид и есть Thor. Генерируется датасет из тех утверждений, которые hammer успешно доказывает. Пример совместной работы человека и hammer-ов см. на картинке, нейросеть тут делает по сути кусок слева, строя своё дерево.

Результаты: в статьях после GPT-f используют уже не только Metamath. Все последние работы тестируют на miniF2F - интегрированном бенчмарке из разных сервисов / датасетов.

Молоток сам решает 10%, GPT-f без дообучения (в том посте описана эта процедура) 24%, объединение этих задач - это 27.5%. Thor решает 29.9% без дообучения. При этом GPT-f с дообучением решает 29.6%. Объединение Thor и дообучения на своих же доказательствах находится за рамками этой статьи.

В среду вас ждёт SOTA на miniF2F, пристегните ремни!

@knowledge_accumulator
  • 🔥 8
  • 🤯 2
  • ❤ 1
  • 👍 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →