TGViewer
Мысли Фединцева Мысли Фединцева @fedintsev_thoughts · 167 subscribers
Post #32 184
ПОЧЕМУ ЛЕ КУН ОШИБАЛСЯ И Я ВМЕСТЕ С НИМ...

Вступил тут в дискуссию в ФБ, которая и навеяла данный пост 🙃 В этой дискуссии автор поста приводил аргумент, очень похожий на тот, который в далеком уже 2023 году приводил отец сверточных нейросетей - Ян ЛеКун. Именитый французский ученый писал примерно следующее: авторегрессионные модели - это тупик, поскольку вероятность правильного ответа экспоненциально затухает с ростом длины генерируемого текста 📉Чуть более года спустя Ле Кун был жестоко попущен вышла "рассуждающая" модель О1, которая генерила длиннющие цепочки рассуждений и при этом резко улучшила результаты на множестве сложных reasoning-бенчмарков. С тех пор этот тренд только набирает обороты. Так почему же Ле Кун был неправ? Тут нам поможет математика.

Процесс рассуждения можно смоделировать используя два состояния: Ct (находимся на правильной ветке) и Wt (неправильная ветка рассуждений). Пусть на каждом шаге вероятность сойти с правильной ветки рассуждения равна e. В случае модели Ле Куна вероятность оказаться в корректной ветке на шаге t+1 равна:

P(Ct+1) = (1-e)P(Ct), отсюда и получается (1-e)^n

К чему стремится такая система? Это можно узнать через стационарное состояние - такое состояние при котором вероятность не изменяется. Запишем его:

P = (1-e)P => P - (1-e)P = 0 => P = 0 для e > 0

Но давайте теперь дадим возможность бэктрекинга: Пусть, находясь на неправильной ветке Wt, на каждом следующем шаге модель с вероятностью r обнаруживает ошибку и возвращается на правильную ветку. Тогда:

P(Ct+1) = (1-e)P(Ct) + rP(Wt) = (1-e)P(Ct) + r(1 - P(Ct))

Выпишем стационарное состояние:

P = (1-e)P + r(1 - P) => P= (1-e)P + r -rP => P(1-1+e+r) = r =>
P = r/(e+r)

А вот это уже интересно! Получается что теперь вероятность находиться на правильной ветке не обязана стремиться к нулю вообще!
Возьмем, к примеру, e = 0.05, r = 0.5, тогда P = 0.909.

Самое интересное здесь даже не конкретное число. Посмотрим на формулу в немного переписанном виде:

P = 1 / (1 + e/r)

Получается, что в пределе всё определяется отношением частоты возникновения ошибок к способности их исправлять. Система может ошибаться сколько угодно раз - само по себе это ещё не означает, что длинное рассуждение обречено. Критично то, умеет ли она замечать собственные ошибки и возвращаться назад.

Отсюда вопрос: интересно, какая r у Ле Куна? 🤪
Threadreaderapp Thread by @ylecun on Thread Reader App @ylecun: I have claimed that Auto-Regressive LLMs are exponentially diverging diffusion processes. Here is the argument: Let e be the probability that any generated token exits the tree of "correct" answers. Then the...…
  • 👍 5
  • 😁 3
  • 🔥 2
  • 💯 1
More from @fedintsev_thoughts
  1. Sep 23, 2026Я в шоке, конечно, что у нас такие репетиторы по математике... P. S. надеюсь, что это был…
  2. Sep 19, 2026Интересные новости с утра 🙂 Оказывается, наш мозг - это не один орган! Разные его части п…
  3. Sep 2, 2026Но если у мыши препарат даёт +12.4% всей жизни и почти +70% оставшейся жизни, а наблюдаемы…
  4. Sep 2, 2026Проблема №5. «Улучшили hallmarks of aging» ≠ доказали замедление старения Уменьшился p16,…
  5. Sep 2, 2026Новости лонжевити Свеженькая, с пылу с жару статья в Nature с громким заголовком “Late-lif…
  6. Aug 30, 2026И здесь получается очень элегантное свойство. Если модель на 99% уверена, что следующим сл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →