TGViewer
Data Secrets Data Secrets @data_secrets · 93.9K subscribers
Post #9924 21.1K
Sakana AI предложили альтернатиный способ обучения нейросетей, вдохновленный тем, как обучается мозг

Любые современные нейросети, которыми мы пользуемся, обучаются при помощи обратного распространения ошибки или backpropagation. Алгоритм достаточно древний, придуман был еще в 70-е, но до сих пор применяется повсеместно.

Однако к нему есть несколько замечаний. Главным образом дело в структуре. Backprop работает строго в три последовательные фазы: сначала сигнал проходит вперед по сети, получается ответ, затем сигнал ошибки идет от выхода обратно к входу, и только потом обновляются веса. Биологически это крайне неправдоподобно: нет механизма, который заставлял бы наши нейроны ждать, пока откуда-то, через все остальные нейроны, придет сигнал ошибки и можно будет обновиться.

А SakanaAI, как известно, отличаются как раз тем, что вдохновляются идеями из нейронауки. И они предлагают смотреть в сторону подхода под названием "predictive coding" (это термин из работ по строению зрительной коры мозга).

Обычно, когда мы обучаем нейросеть, оптимизируются только ее веса. В PC же мы оптимизируем и веса, и сами активации каждого слоя: каждый слой пытается предсказать активность следующего слоя, и наверх идет только остаток, который он не смог объяснить. Идея в том, что система должна найти локальное равновесие между ошибкой предсказания снизу и сверху, и тогда ответы сети будут хорошо предсказывать целевую переменную.

Этот подход придумали не в SakanaAI, он довольно известный. Но, к сожалению, не рабочий: в глубоких сетях сигнал просто затухает, и ничего не учится, потому что сетка не понимает, куда двигать веса.

Sakana внесли всего одно небольшое дополнение – и метод стал хорошо обучать сети до 1000 слоев. Помогло старое советское... добавление множителя Лагранжа. Еще в 1988 году Лекун показал: если записать нейросеть как задачу с ограничениями (как делает PC) и присвоить каждому ограничению множитель Лагранжа λ, то в точке равновесия λ будет в точности равен backprop-градиенту. Это математический факт, который Sakana и догадались использовать.

То есть если в ванильном PC сигнал примерный, то в подходе Sakana – PC-ALM – он на линейных сетях точно сходится к backprop-градиенту, используя только связь с соседними слоями, без единого глобального прохода.

На разных бенчмарках PC-ALM почти не отстает от backprop (разница ~2 п.п. точности на MNIST). И да, выигрыша в точности или скорости обучения над backprop нет. Выигрывать он (возможно) будет только на нейроморфном железе когда-то в будущем. Зато мы, возможно, стали на шаг ближе к тому, чтобы воссоздать процесс обучения живого мозга. Ну и просто красиво ☕️

https://pub.sakana.ai/pc-alm/
  • ❤ 180
  • 🔥 64
  • ⚡ 14
  • 🤔 9
  • 🤯 6
  • 🦄 5
  • ☃ 2
  • 😁 2
  • 🤗 2
  • 💯 1
More from @data_secrets
  1. Sep 21, 2026Вышел Grok-4.7 Кратко: – По уровню: как будто чуть лучше Sol на кодинге и агентских задача…
  2. Sep 21, 2026Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала прим…
  3. Sep 21, 2026Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base Модель обучена по…
  4. Sep 21, 2026Post #9975
  5. Sep 21, 2026Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих»…
  6. Sep 20, 2026Теперь у нас есть Nano Banana 2.0 дома! Alibaba выпустили в опенсорс Qwen-Image-2.1: генер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →