TGViewer
Data Secrets Data Secrets @data_secrets · 94.1K subscribers
Post #9820 16.8K
Революционная и очень опасная архитектура новой Astra оказалась выдумкой журналистов ☕️

На днях по сети разлетелась громкая статья от The Information. В ней утверждалось, что в основе новой модели OpenAI под кодовым названием Astra лежит некая революционная архитектура «recurrent depth» или «looped transformer».

Идея «looped transformer» в следующем: вместо того чтобы гонять фиксированный стек различных слоев ровно один раз, модель прогоняет скрытое состояние через один и тот же блок слоев несколько раз перед тем, как выдать следующий токен.

Те, кто следит за ML-статьями, уже на этом моменте поняли, что никакой революции тут нет. Это довольно известный небольшой архитектурный трюк, который восходит корнями к работе Google "Mixture-of-Recursions" с NeurIPS. Мы разбирали ее здесь: https://t.me/data_secrets/7384. Эту идею уже много раз использовали в опенсорсе.

Тем не менее, хайп статьи The Information почти достиг стратосферы. Дело в том, что помимо рассказов о революционной архитектуре, в тексте также утверждается, что looped transformer скрывает chain-of-thought. Точнее: в отличие от моделей, которые показывают рассуждения текстом, в looped transformer эти шаги скрыти внутри модели, и поэтому человеку недоступны.

Так что новость почти сразу превратилась из архитектурной детали в спор о безопасности ИИ. OpenAI уже успели обвинить в том, что они переходят черту. Но на деле сам тезис про скрытые CoT оказывается очень спорным.

Якуб Пахоцкий публично возразил, заявив, что репортаж вводит в заблуждение. А Себастьян Рашка написал про это вот так:

Возможно, журналист The Information имел в виду какую-то другую технику или неверно понял, как работает looped transformer.
Само по себе повторное использование слоев не подавляет видимый chain-of-thought, оно лишь добавляет вычисления в скрытых состояниях перед генерацией очередного токена, точно так же, как это делают обычные слои трансформера.

Единственная правдоподобная связь, которую можно выделить: если модель делает больше таких рекуррентных проходов, ей может требоваться меньше промежуточных токенов-рассуждений. То есть больше вычислений происходит в латентных активациях, которые нельзя прочитать как текст. Но точно такой же эффект дало бы и простое увеличение размера модели – например, переход от GPT-5.6 Luna к GPT-5.6 Sol.


Какой направшивается вывод, решайте сами
  • 😁 106
  • ❤ 23
  • 👍 5
  • 🤔 3
  • 🎉 3
  • ⚡ 1
  • 🔥 1
  • 👏 1
More from @data_secrets
  1. Sep 26, 2026Топ-10 советов, как стать миллионером
  2. Sep 26, 2026Навайбкодить AI-агента сейчас можно за вечер. А вот довести его до прода так, чтобы он не…
  3. Sep 26, 2026OpenAI прямо сейчас приостановила все обучение мощных моделей из-за нового инцидента https…
  4. Sep 26, 2026Claude посчитал девятипетлевую амплитуду в N=4 SYM. Эту задачу эксперты долго считали слиш…
  5. Sep 25, 2026Исследователи из AIRI запустили открытое сообщество для решения NetHack. Зовут объединятьс…
  6. Sep 25, 2026Новая обложка The Economist Журналисты: да не нагнетаем мы Также журналисты:
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →