Вступил тут в дискуссию в ФБ, которая и навеяла данный пост 🙃 В этой дискуссии автор поста приводил аргумент, очень похожий на тот, который в далеком уже 2023 году приводил отец сверточных нейросетей - Ян ЛеКун. Именитый французский ученый писал примерно следующее: авторегрессионные модели - это тупик, поскольку вероятность правильного ответа экспоненциально затухает с ростом длины генерируемого текста 📉Чуть более года спустя
Процесс рассуждения можно смоделировать используя два состояния: Ct (находимся на правильной ветке) и Wt (неправильная ветка рассуждений). Пусть на каждом шаге вероятность сойти с правильной ветки рассуждения равна e. В случае модели Ле Куна вероятность оказаться в корректной ветке на шаге t+1 равна:
P(Ct+1) = (1-e)P(Ct), отсюда и получается (1-e)^n
К чему стремится такая система? Это можно узнать через стационарное состояние - такое состояние при котором вероятность не изменяется. Запишем его:
P = (1-e)P => P - (1-e)P = 0 => P = 0 для e > 0
Но давайте теперь дадим возможность бэктрекинга: Пусть, находясь на неправильной ветке Wt, на каждом следующем шаге модель с вероятностью r обнаруживает ошибку и возвращается на правильную ветку. Тогда:
P(Ct+1) = (1-e)P(Ct) + rP(Wt) = (1-e)P(Ct) + r(1 - P(Ct))
Выпишем стационарное состояние:
P = (1-e)P + r(1 - P) => P= (1-e)P + r -rP => P(1-1+e+r) = r =>
P = r/(e+r)
А вот это уже интересно! Получается что теперь вероятность находиться на правильной ветке не обязана стремиться к нулю вообще!
Возьмем, к примеру, e = 0.05, r = 0.5, тогда P = 0.909.
Самое интересное здесь даже не конкретное число. Посмотрим на формулу в немного переписанном виде:
P = 1 / (1 + e/r)
Получается, что в пределе всё определяется отношением частоты возникновения ошибок к способности их исправлять. Система может ошибаться сколько угодно раз - само по себе это ещё не означает, что длинное рассуждение обречено. Критично то, умеет ли она замечать собственные ошибки и возвращаться назад.
Отсюда вопрос: интересно, какая r у Ле Куна? 🤪