TGViewer
Data Secrets Data Secrets @data_secrets · 94K subscribers
Post #6895 20.5K
Исследователи из лабы SakanaAI предложили новую архитектуру нейросетей, вдохновленную биологическими нейронными процессами – Continuous Thought Machine

Кстати, SakanaAI – это та самая японская лаборатория, выпустившая ИИ-ученого, статья которого прошла рецензирование на ICLR воркшоп. Ну так вот ⬇️

Ключевая фишка CTM (Continuous Thought Machine) в наличии тиков мыслей. Аналогия с мозгом тут в том, что человек на самом деле не получает ответы за один "проход" по нейронам, как это делается, например, в трансформерах.

Живые нейроны активны всё время, через миллисекунды после первого сигнала информация осмысливается глубже, подключаются новые области коры и тд. Это и называется "тик". В нейросетях один тик – это как бы один прямой проход. В трансформерах для получения ответа тик всегда один, а в CTM их может быть и 5, и 10, и 50. Модель сама решает, сколько ей нужно – в зависимости от сложности задачи.

При этом проходы не независимые. Для каждого нейрона мы храним историю пред- и пост-активаций, чтобы он мог «смотреть» на свою динамику на предыдущих тиках. И, кстати, нейроны в CTM тоже необычные. Здесь это не просто сумма взвешенных входов, как в большинстве моделей, а самостоятельный мини-перцептрон (MLP). Все это тоже построено на аналогиях из биологии.

Ну и еще одна ключевая особенность CTM – это синхронизация нейронов. В нейробиологии считается, что важны не столько независимые активации нейронов, сколько то, как и когда они активируются относительно друг друга. Нейроны, чьи осцилляции или пики потенциала происходят синхронно, чаще участвуют в совместной обработке информации.

Поэтому здесь специально вычисляется так называемая матрица синхронизаций. Она показывает скалярные корреляции временных рядов активаций. Самые важные подмножества затем идут либо в слой внимания, либо напрямую проецируются в логиты.

И да, все это вполне прилично (и иногда лучше классических архитектур) работает на классических задачах типа ImageNet-1K, CIFAR-10 и MNIST, а еще модель отлично решает лабиринты.

В общем, работа большая и сложная, но в статье все расписано вполне доходчиво, так что советуем почитать полностью или полистать интерактивный репорт

Код в опенсорсе, кстати
  • 👍 128
  • ❤ 46
  • 🔥 39
  • 🤯 6
  • 🤨 6
  • ❤‍🔥 3
  • 🤔 1
  • 🐳 1
  • 🍓 1
More from @data_secrets
  1. Sep 21, 2026Вышел Grok-4.7 Кратко: – По уровню: как будто чуть лучше Sol на кодинге и агентских задача…
  2. Sep 21, 2026Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала прим…
  3. Sep 21, 2026Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base Модель обучена по…
  4. Sep 21, 2026Post #9975
  5. Sep 21, 2026Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих»…
  6. Sep 20, 2026Теперь у нас есть Nano Banana 2.0 дома! Alibaba выпустили в опенсорс Qwen-Image-2.1: генер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →