TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #43 1.98K
Autoformalization with Large Language Models [2022] - собираем чемпиона по математике среди алгоритмов.

Продолжаем серию постов про док-ва теорем: раз, два, три.

В данной работе в качестве базовой модели используется Thor. Дополнительно применяется схема из статьи GPT-f - после начального претрейна и файнтюна модели мы запускаем процесс под названием Expert Iteration:
1) Применяем нашу модель на тренировочном датасете задач и пытаемся доказать каждую из них.
2) Собираем датасет из успешных доказательств, на котором мы дообучаем нашу языковую модель.
3) Повторяем процедуру, пока не надоест

В чём ключевая новизна статьи - авторы пытаются расширить тренировочный датасет: берут другой датасет задач по математике, написанных на естественном языке, и просят Codex перевести эти задачи на "формальный язык", с которым мы работаем. По словам авторов, они проверили качество перевода на случайных 150 задачках и получили 38 корректных переводов.

В остальном ничего сильно нового в статье нет, после 2-х итераций Expert Iteration с использованием "автоформализованных" задач получается 29.9% на miniF2F-test превратить в 35.2%!
К сожалению, я не нашёл ablation по поводу того, помогает ли тут именно добавление автоформализованных задач, а не только Expert Iteration.

В пятницу подведём итоги.

@knowledge_accumulator
  • 👍 6
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →