Итак, в чём проблема с нейросетями в математике?
Мысли по результатам предыдущих постов.
Прежде всего обозначу критерий успеха - лично мне не будет особо интересно, если алгоритмы научатся хорошо решать простые задачи, описанные на естественном языке. Меня интересует возможность доказывать что-то новое, что ещё не было доказано. Как мы видим из AlphaTensor, это в целом осуществимо, и вопрос в том, почему успеха нет в более общем классе задач.
Я вижу 2 главные проблемы:
1) Неправильное представление данных
В эру хайпа языковых моделей решением на поверхности является рассмотрение математических утверждений как последовательности токенов на формальном языке. Однако, последовательность токенов не содержит в себе почти никакой априорной информации о структуре утверждений. В сфере языка эта проблема нивелируется огромным количеством данных, но на математическом языке таких данных нет и не может быть.
Простейшая иллюстрация - утверждение на формальном языке инвариантно к именам используемых переменных, тогда как с точки зрения языковой модели это разные высказывания.
2) Неправильная генерация действий
Я считаю, что генеративные авторегрессионные модели глобально обречены - генерировать формальные утверждения по 1 токену это плохая идея, но ничего лучше у нас пока что нет. Эта проблема тесно связана с первой, поскольку другой способ представлять утверждения может подсказать другой способ их генерации.
Доказать существование проблемы очень легко - GPT-f решает не все задачи, которые решает простой эвристикой молоток (писал тут в конце поста). Иначе бы молоток был не нужен и не помогал вообще.
Вообще, на мой взгляд, приложение языковых моделей к математике наглядно вскрывает проблемы, которые есть в языковых моделях в целом. Надеюсь, что перегрев ожиданий от ИИ не похоронит инвестиции в область через несколько лет, а исследователи не будут страдать от tunnel vision и забивать отвёрткой гвозди. Тогда мы, может быть, поймём наконец, равны ли P и NP.
@knowledge_accumulator
Post #44
1.48K
- 👍 8
- 🔥 5
- 🤔 1
- 💯 1