TGViewer
gonzo-обзоры ML статей gonzo-обзоры ML статей @gonzo_ml · 24.3K subscribers
Post #4618 4.15K
Очень классная работа, мне нравится подход. Развитие идей десятков и сотен предыдущих работ и продолжение линейки: Transformer-XL, Compressive Transformer, RMT, LCM. Я бы даже сказал, что это LCM 2.0 (Large Concept Model).

В отличие от обычного LCM, который работал над предложениями, но не совсем end-to-end, используя внешние SONAR энкодеры и декодеры для предложений, Thought Gestalt (TG) работает на двух уровнях. На внешнем уровне он пользуется последовательностью гештальтов-предложений, генерируемых автоматом через дифференцируемую память, а на внутреннем он генерит токен-за-токеном как обычный трансформер, но используя кросс-аттеншн на память гештальтов.

Это мне кажется очень правильный подход. Ждём развития!

Modeling Language as a Sequence of Thoughts
Nasim Borazjanizadeh, James L. McClelland
Статья: https://arxiv.org/abs/2512.25026
Ревью: https://arxiviq.substack.com/p/modeling-language-as-a-sequence-of

# TL;DR

ЧТО сделали: Авторы представили модель Thought Gestalt (TG) — архитектуру рекуррентного трансформера, который обрабатывает текст не сплошным потоком токенов, а предложение за предложением. Вместо хранения полной истории прошлых токенов (как в классическом KV-кэше), TG сжимает каждое обработанное предложение в единое векторное представление — «гештальт» — и сохраняет его в дифференцируемой памяти. Ключевая фишка: модель обучается end-to-end, то есть градиенты от предсказания будущих токенов текут назад через память, оптимизируя параметры, которые создали представления прошлых предложений.

ПОЧЕМУ это важно: Подход бросает вызов доминированию статического контекстного окна, показывая, что рекуррентность на уровне событий может быть эффективнее по данным, чем простое внимание к токенам. Авторы показывают, что TG обходит GPT-2 в scaling laws (требуя на ~5-8% меньше данных для той же перплексии) и значительно смягчает «Проклятие обратимости» (Reversal Curse, https://arxiv.org/abs/2309.12288) — ситуацию, когда модель выучила A -> B, но не может вывести B -> A. Это намекает на то, что сжатие контекста в латентные «мысли» создаёт более надёжные семантические репрезентации, чем поверхностная статистика токенов.

Открыть гештальт: https://t.me/gonzo_ML_podcasts/2181
Telegram gonzo_ML_podcasts Гештальт мысли: Сжимаем контекст в дифференцируемую память событий Modeling Language as a Sequence of Thoughts Nasim Borazjanizadeh, James L. McClelland Статья: https://arxiv.org/abs/2512.25026 Ревью: https://arxiviq.substack.com/p/modeling-language-as-a…
  • 🔥 14
  • ❤ 9
  • 👍 4
  • 👎 1
  • 👀 1
More from @gonzo_ml
  1. Sep 21, 2026Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy…
  2. Sep 21, 2026Хотите доказать своего Навье-Стокса-Чейна? Это не так далеко, как кажется.
  3. Sep 20, 2026photo post
  4. Sep 20, 2026В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрова…
  5. Sep 20, 2026Мемы про муху не прекращаются. Извинити.
  6. Sep 20, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →